Aller au contenu
  1. OpenAI News60

    OpenAI 发布 SWE-Lancer 基准

    OpenAI 发布 SWE-Lancer 基准, 用于评估前沿 LLM 能否完成真实自由职业软件工程任务并赚取 100 万美元.

  1. OpenAI News62

    OpenAI présente SWE-bench Verified

    OpenAI publie SWE-bench Verified, un sous-ensemble de SWE-bench validé par des humains, destiné à évaluer plus fiablement la capacité des modèles d'IA à résoudre des problèmes logiciels réels.

    Motif de la recommandation :OpenAI publie un sous-ensemble validé par des humains de SWE-bench, ce qui permet de situer la fiabilité de l'évaluation des capacités de codage des modèles.

Fin de la liste