LiveBench Global Average
LiveBench · Le jeu de questions est renouvelé en continu et les réponses peuvent être vérifiées automatiquement. Sert à voir si un modèle tient bon après un changement de questions.
Ce qu'il mesure, comment il le mesure
Conserver le Global Average officiel comme référence globale ; les scores officiels utilisent des tâches spécialisées non redondantes.
Comment utiliser ces preuves
Le Global Average brut reste à titre de référence ; le vote officiel utilise des tâches spécialisées non redondantes.
Scores d'évaluation
Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.
| Rang sur le classement d'origine | Modèle au classement d'origine | Score brut | Configuration de référence |
|---|---|---|---|
| 1 | claude-fable-5-1-max-effortAnthropic | 83.4% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 2 | claude-opus-5-5-max-effortAnthropic | 83.2% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 3 | claude-fable-5-max-effortAnthropic | 83.0% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 4 | gpt-6-astra-maxOpenAI | 82.2% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 6 | gpt-6.1-sol-maxOpenAI | 81.6% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 7 | muse-spark-1.3-xhighMeta | 81.6% | xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 9 | deepseek-v4.1-flash-maxDeepSeek | 81.1% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 10 | gpt-5.6-sol-maxOpenAI | 81.1% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 11 | gpt-5.5-xhighOpenAI | 80.2% | xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 12 | claude-opus-5-max-effortAnthropic | 80.1% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 13 | smaug-agenticAbacus.AI | 79.5% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 14 | gpt-6-sol-maxOpenAI | 79.2% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 15 | kimi-k3Moonshot AI | 79.2% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 16 | gemini-3.7-flash-highGoogle | 78.8% | High « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 17 | qwen3.8-maxAlibaba | 78.5% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 18 | grok-4.6xAI | 78.0% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 19 | gpt-5.4-xhighOpenAI | 78.0% | xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 20 | muse-spark-1.2-xhighMeta | 78.0% | xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 21 | gpt-5.6-terra-maxOpenAI | 77.9% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 23 | deepseek-v4-pro-0813DeepSeek | 77.4% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 24 | smaug-flashAbacus.AI | 77.4% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 25 | grok-4.7-xhighxAI | 77.4% | xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 26 | gemini-3.1-pro-preview-highGoogle | 77.0% | High « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 27 | smaug-miniAbacus.AI | 76.9% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 28 | deepseek-v4-flash-vision-expDeepSeek | 76.8% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 29 | claude-opus-4-7-xhigh-effortAnthropic | 76.5% | xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 30 | claude-opus-4-8-max-effortAnthropic | 76.2% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 31 | qwen3.8-flash-nextAlibaba | 76.2% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 32 | glm-5.3Z.ai | 76.1% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 33 | claude-sonnet-5-xhigh-effortAnthropic | 76.0% | xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
Limites de l'évaluation et attribution des données
Le score moyen global dilue les variations de capacités spécifiques ; référence croisée uniquement, sans double comptage. L'organisation participante Abacus.AI développe aussi le modèle Smaug ; ses scores exclusifs doivent être complétés par d'autres sources indépendantes.
Licence des données :Apache 2.0
Résultats publiés par LiveBench ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.