Aller au contenu
OpenAI News·· 2025-04-02AI Score38

PaperBench : évaluer la capacité des agents IA à reproduire la recherche en IA

PaperBench: Evaluating AI’s Ability to Replicate AI Research

AI Introduction

OpenAI présente PaperBench, un benchmark qui évalue la capacité des agents IA à reproduire de la recherche de pointe en IA. Le benchmark mesure si ces agents peuvent répliquer des travaux de recherche publiés, sans précision sur les modèles testés ni les scores obtenus.

Source :OpenAI News · openai.com