SWE-rebench
Nebius / programmation · Collecte continue de problèmes issus de dépôts réels, pour comparer la capacité des modèles à corriger du logiciel dans plusieurs langages de programmation.
Ce qu'il mesure, comment il le mesure
Fenêtre de tâches, environnement ReAct et protocole d'interaction text/tools figés, avec taux de résolution moyen et erreur standard sur plusieurs exécutions ; ne pas confondre un produit Agent complet avec un modèle de base.
Comment utiliser ces preuves
Observation candidate : les tâches sur dépôts réels méritent d'être ajoutées ; en attente de dates d'exécution vérifiables, d'un protocole de résultats stable et de limites de rediffusion ; collecte et notation automatiques pas encore activées.
Limites de l'évaluation et attribution des données
Le renouvellement des tâches, l'environnement d'exécution et la fenêtre de tâches affectent la comparabilité ; une maintenance récente du site ne signifie pas que tous les modèles ont été retestés.
Licence des données :Jeu de données officiel Hugging Face CC BY 4.0 sert de banque de tâches ; l'export stable et les limites de rediffusion des résultats finaux du site ne sont pas encore confirmés.
Résultats publiés par Nebius ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.