Aller au contenu

LiveBench Global Average

LiveBench · Le jeu de questions est renouvelé en continu et les réponses peuvent être vérifiées automatiquement. Sert à voir si un modèle tient bon après un changement de questions.

Évaluation officielle
dans le Actu Créaflash surRéférence croisée
Budget de preuvesHors classement
Date des données amont09/30 03:01
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

Conserver le Global Average officiel comme référence globale ; les scores officiels utilisent des tâches spécialisées non redondantes.

Comment utiliser ces preuves

Le Global Average brut reste à titre de référence ; le vote officiel utilise des tâches spécialisées non redondantes.

Scores d'évaluation

Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration de référence
1claude-fable-5-1-max-effortAnthropic83.4%Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
2claude-opus-5-5-max-effortAnthropic83.2%Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
3claude-fable-5-max-effortAnthropic83.0%Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
4gpt-6-astra-maxOpenAI82.2%Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
6gpt-6.1-sol-maxOpenAI81.6%Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
7muse-spark-1.3-xhighMeta81.6%xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
9deepseek-v4.1-flash-maxDeepSeek81.1%Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
10gpt-5.6-sol-maxOpenAI81.1%Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
11gpt-5.5-xhighOpenAI80.2%xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
12claude-opus-5-max-effortAnthropic80.1%Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
13smaug-agenticAbacus.AI79.5%Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
14gpt-6-sol-maxOpenAI79.2%Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
15kimi-k3Moonshot AI79.2%Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
16gemini-3.7-flash-highGoogle78.8%High « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
17qwen3.8-maxAlibaba78.5%Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
18grok-4.6xAI78.0%Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
19gpt-5.4-xhighOpenAI78.0%xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
20muse-spark-1.2-xhighMeta78.0%xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
21gpt-5.6-terra-maxOpenAI77.9%Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
23deepseek-v4-pro-0813DeepSeek77.4%Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
24smaug-flashAbacus.AI77.4%Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
25grok-4.7-xhighxAI77.4%xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
26gemini-3.1-pro-preview-highGoogle77.0%High « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
27smaug-miniAbacus.AI76.9%Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
28deepseek-v4-flash-vision-expDeepSeek76.8%Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
29claude-opus-4-7-xhigh-effortAnthropic76.5%xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
30claude-opus-4-8-max-effortAnthropic76.2%Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
31qwen3.8-flash-nextAlibaba76.2%Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
32glm-5.3Z.ai76.1%Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
33claude-sonnet-5-xhigh-effortAnthropic76.0%xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié.
Limites de l'évaluation et attribution des données

Le score moyen global dilue les variations de capacités spécifiques ; référence croisée uniquement, sans double comptage. L'organisation participante Abacus.AI développe aussi le modèle Smaug ; ses scores exclusifs doivent être complétés par d'autres sources indépendantes.

Licence des données :Apache 2.0

Résultats publiés par LiveBench ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.