Aller au contenu

DeepSWE v1.1

DataCurve / programmation · Modifier des dépôts et corriger des bugs dans un environnement d'assistant de programmation unifié : ce qui est comparé, c'est le modèle de code lui-même.

Évaluation officielle
dans le Actu Créaflash surClassé
Budget de preuves4.2%
Date des données amont09/22 14:27
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

On ne retient que pass@1 ;Dans le harness unifié, la configuration représentative est choisie selon une priorité fixée à l'avance entre les niveaux de raisonnement.

Comment utiliser ces preuves

Après vérification via le protocole mono-modèle, participe au classement de référence dans la limite de la part de la famille de questions du domaine de compétence concerné ; les mesures d'une même famille de questions n'augmentent pas la part totale de la famille. La part effective figure dans l'enregistrement de calcul en cours.

Scores d'évaluation

Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration de référence
2gemini-3-8-flashGoogle73.8%High « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
3claude-opus-5Anthropic73.6%Max « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
4gpt-6-astraOpenAI73.2%Max « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
9gpt-5-6-solOpenAI72.7%Max « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
13claude-fable-5Anthropic69.7%Max « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
14gpt-5-6-terraOpenAI69.6%Max « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
16glm-5-3Z.ai69.0%Max « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
19kimi-k3Moonshot AI68.5%Max « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
21gpt-5-6-lunaOpenAI67.2%Max « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
22gpt-5-5OpenAI67.0%xHigh « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
24grok-4-6xAI66.7%xHigh « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
27gemini-3-7-flashGoogle65.3%High « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
30glm-5-3-flashZ.ai63.4%Max « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
31deepseek-v4-proDeepSeek62.8%Max « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
35claude-opus-4-8Anthropic59.0%Max « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
37qwen3-8-maxAlibaba57.5%xHigh « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
39muse-spark-1-2Meta54.9%xHigh « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
42claude-sonnet-5Anthropic53.8%Max « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
43grok-4-5xAI53.8%High « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
46muse-spark-1-1Meta53.3%xHigh « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
46deepseek-v4-flashDeepSeek53.3%Max « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
48gpt-5-4OpenAI51.8%xHigh « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
53gemini-3-6-flashGoogle46.7%High « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
56glm-5-2Z.ai43.8%Max « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
61gemini-3-5-flashGoogle36.1%High « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
63kimi-k2-7-codeMoonshot AI30.5%système complet · mini-swe-agent · deepswe-v1.1:mini-swe-agent
65claude-sonnet-4-6Anthropic29.9%High « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
68gemini-3-1-pro-previewGoogle11.7%High « inférence » · mini-swe-agent · deepswe-v1.1:mini-swe-agent
Limites de l'évaluation et attribution des données

Reste la performance système du modèle+mini-swe-agent ; tout changement de version majeure doit être isolé dans un instantané.

Licence des données :résultats structurés publics officiels ; observation privée réservée aux administrateurs, licence à vérifier avant publication

Résultats publiés par DataCurve ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.