OpenAI News·· 2026-07-08AI Score38
OpenAI analyse les problèmes de SWE-Bench Pro dans l'évaluation du code
Separating signal from noise in coding evaluations
AI Introduction
Une nouvelle analyse d'OpenAI révèle des problèmes dans SWE-Bench Pro, un benchmark de code populaire, remettant en cause la fiabilité et la précision de l'évaluation des modèles d'IA.
Source :OpenAI News · openai.com