Aller au contenu
OpenAI News·· 2026-07-08AI Score38

OpenAI analyse les problèmes de SWE-Bench Pro dans l'évaluation du code

Separating signal from noise in coding evaluations

AI Introduction

Une nouvelle analyse d'OpenAI révèle des problèmes dans SWE-Bench Pro, un benchmark de code populaire, remettant en cause la fiabilité et la précision de l'évaluation des modèles d'IA.

Source :OpenAI News · openai.com