OpenAI 发布 SWE-Lancer 基准
OpenAI 发布 SWE-Lancer 基准, 用于评估前沿 LLM 能否完成真实自由职业软件工程任务并赚取 100 万美元.
OpenAI 发布 SWE-Lancer 基准, 用于评估前沿 LLM 能否完成真实自由职业软件工程任务并赚取 100 万美元.
OpenAI publie SWE-bench Verified, un sous-ensemble de SWE-bench validé par des humains, destiné à évaluer plus fiablement la capacité des modèles d'IA à résoudre des problèmes logiciels réels.
Motif de la recommandation :OpenAI publie un sous-ensemble validé par des humains de SWE-bench, ce qui permet de situer la fiabilité de l'évaluation des capacités de codage des modèles.
OpenAI publie une évaluation des grands modèles de langage entraînés sur du code. Le contenu détaillé de cette évaluation n'est pas disponible.