LiveBench · Programmation générale
LiveBench / programmation · Coding + Agentic Coding Moyenne des deux, à 50 % chacun.
Ce qu'il mesure, comment il le mesure
Lecture des sous-scores non arrondis de Coding et Agentic Coding. La programmation directe et la programmation avec outils unifiés entrent séparément dans le calcul ; cette page source conserve la moyenne des deux, la page modèle affichant aussi les sous-scores.
Comment utiliser ces preuves
La programmation directe et la programmation avec outils sont comparées séparément selon différentes familles de tâches, toutes deux relevant du domaine de la programmation ; leur moyenne n'est pas recomptée.
Scores d'évaluation
Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.
| Rang sur le classement d'origine | Modèle au classement d'origine | Score brut | Configuration de référence |
|---|---|---|---|
| 1 | claude-opus-5-5-max-effortAnthropic | 80.5% | Max « inférence » |
| 2 | deepseek-v4.1-flash-maxDeepSeek | 78.7% | Configuration par défaut de la source |
| 4 | claude-fable-5-1-max-effortAnthropic | 76.2% | Max « inférence » |
| 5 | claude-fable-5-max-effortAnthropic | 74.1% | Max « inférence » |
| 6 | claude-sonnet-5-5-max-effortAnthropic | 73.8% | Max « inférence » |
| 7 | smaug-agenticAbacus.AI | 73.6% | Configuration par défaut de la source |
| 8 | claude-opus-5-max-effortAnthropic | 73.3% | Max « inférence » |
| 9 | muse-spark-1.3-xhighMeta | 72.6% | xHigh « inférence » |
| 10 | kimi-k3Moonshot AI | 71.8% | Configuration par défaut de la source |
| 11 | gpt-5.6-sol-maxOpenAI | 70.1% | Max « inférence » |
| 12 | claude-sonnet-5-xhigh-effortAnthropic | 70.0% | xHigh « inférence » |
| 13 | glm-5.3Z.ai | 69.9% | Configuration par défaut de la source |
| 14 | smaug-flashAbacus.AI | 69.1% | Configuration par défaut de la source |
| 15 | gpt-6-astra-maxOpenAI | 68.8% | Max « inférence » |
| 16 | qwen3.8-maxAlibaba | 68.8% | Configuration par défaut de la source |
| 18 | gemini-3.7-flash-highGoogle | 68.6% | High « inférence » |
| 19 | qwen3.8-27bAlibaba | 68.5% | Configuration par défaut de la source |
| 20 | smaug-miniAbacus.AI | 68.1% | Configuration par défaut de la source |
| 21 | gpt-5.5-xhighOpenAI | 68.1% | xHigh « inférence » |
| 22 | glm-5.3-flashZ.ai | 67.9% | Configuration par défaut de la source |
| 23 | muse-spark-1.1-xhighMeta | 67.8% | xHigh « inférence » |
| 24 | muse-spark-1.2-xhighMeta | 67.6% | xHigh « inférence » |
| 25 | gpt-6.1-sol-maxOpenAI | 67.5% | Max « inférence » |
| 26 | gpt-6-sol-maxOpenAI | 67.3% | Max « inférence » |
| 27 | qwen3.8-flash-nextAlibaba | 67.1% | Configuration par défaut de la source |
| 28 | grok-4.6xAI | 66.9% | Configuration par défaut de la source |
| 29 | deepseek-v4-flash-vision-expDeepSeek | 66.7% | Configuration par défaut de la source |
| 30 | gpt-5.6-terra-maxOpenAI | 66.6% | Max « inférence » |
| 31 | gpt-5.2-codexOpenAI | 66.5% | Configuration par défaut de la source |
| 32 | claude-opus-4-7-xhigh-effortAnthropic | 66.4% | xHigh « inférence » |
Limites de l'évaluation et attribution des données
La moyenne des deux mesure une performance combinée et ne peut pas être prise pour un score Coding isolé. Lorsque la page officielle change de catégorie ou inclut ou non des modèles affinés, les scores et le classement changent en conséquence. L'organisation participante Abacus.AI développe aussi le modèle Smaug ; ses scores exclusifs doivent être complétés par d'autres sources indépendantes.
Licence des données :Apache 2.0
Les scores par catégorie sont publiés par LiveBench ; ce site les agrège à poids égal selon les deux catégories ci-dessus et les classe. Les échelles de score étant différentes, elles ne peuvent pas être additionnées directement ; le classement de référence utilise une échelle de référence fixe.