OpenAI News·· 2025-04-02AI Score38
PaperBench : évaluer la capacité des agents IA à reproduire la recherche en IA
PaperBench: Evaluating AI’s Ability to Replicate AI Research
AI Introduction
OpenAI présente PaperBench, un benchmark qui évalue la capacité des agents IA à reproduire de la recherche de pointe en IA. Le benchmark mesure la reproduction d'articles de recherche de pointe par les agents, sans préciser les scores obtenus ni les modèles évalués.
Source :OpenAI News · openai.com