OpenAI analyse les problèmes de SWE-Bench Pro dans l'évaluation du code
Une nouvelle analyse d'OpenAI révèle des problèmes dans SWE-Bench Pro, un benchmark de code populaire, remettant en cause la fiabilité et la précision de l'évaluation des modèles d'IA.