Aller au contenu

SWE-rebench

Nebius / programmation · Collecte continue de problèmes issus de dépôts réels, pour comparer la capacité des modèles à corriger du logiciel dans plusieurs langages de programmation.

Évaluation officielle
dans le Actu Créaflash surEn observation
Budget de preuvesHors classement
Date des données amontÀ confirmer
Dernière synchronisation réussieCollecte non commencée

Ce qu'il mesure, comment il le mesure

Fenêtre de tâches, environnement ReAct et protocole d'interaction text/tools figés, avec taux de résolution moyen et erreur standard sur plusieurs exécutions ; ne pas confondre un produit Agent complet avec un modèle de base.

Comment utiliser ces preuves

Observation candidate : les tâches sur dépôts réels méritent d'être ajoutées ; en attente de dates d'exécution vérifiables, d'un protocole de résultats stable et de limites de rediffusion ; collecte et notation automatiques pas encore activées.

Limites de l'évaluation et attribution des données

Le renouvellement des tâches, l'environnement d'exécution et la fenêtre de tâches affectent la comparabilité ; une maintenance récente du site ne signifie pas que tous les modèles ont été retestés.

Licence des données :Jeu de données officiel Hugging Face CC BY 4.0 sert de banque de tâches ; l'export stable et les limites de rediffusion des résultats finaux du site ne sont pas encore confirmés.

Résultats publiés par Nebius ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.