LiveBench · Langage et instructions
LiveBench · Language + IF Moyenne des deux, à 50 % chacun.
Ce qu'il mesure, comment il le mesure
Calculer d'abord séparément les scores par catégorie Language et IF, puis en faire la moyenne à 50 % chacun, en arrondissant à une décimale. Cette moyenne des deux diffère du score obtenu en sélectionnant une seule catégorie sur le site officiel. Language mesure la compréhension linguistique, IF mesure le respect des instructions et des contraintes de format ; elle ne permet pas de juger le style d'écriture romanesque.
Comment utiliser ces preuves
Après vérification via le protocole mono-modèle, participe au classement de référence dans la limite de la part de la famille de questions du domaine de compétence concerné ; les mesures d'une même famille de questions n'augmentent pas la part totale de la famille. La part effective figure dans l'enregistrement de calcul en cours.
Scores d'évaluation
Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.
| Rang sur le classement d'origine | Modèle au classement d'origine | Score brut | Configuration de référence |
|---|---|---|---|
| 1 | gemini-3.8-flash-highGoogle | 84.6% | High « inférence » |
| 2 | claude-fable-5-max-effortAnthropic | 83.2% | Max « inférence » |
| 3 | gemini-3.7-flash-highGoogle | 82.7% | High « inférence » |
| 4 | gpt-6-astra-maxOpenAI | 82.5% | Max « inférence » |
| 5 | gemini-3.1-pro-preview-highGoogle | 82.2% | High « inférence » |
| 6 | gpt-6.1-sol-maxOpenAI | 82.1% | Max « inférence » |
| 7 | claude-fable-5-1-max-effortAnthropic | 81.2% | Max « inférence » |
| 8 | muse-spark-1.3-xhighMeta | 80.4% | xHigh « inférence » |
| 9 | gemini-3.5-flash-highGoogle | 80.1% | High « inférence » |
| 11 | gpt-5.6-sol-maxOpenAI | 79.8% | Max « inférence » |
| 12 | gemini-3.6-flash-highGoogle | 79.6% | High « inférence » |
| 13 | gpt-5.5-xhighOpenAI | 79.0% | xHigh « inférence » |
| 14 | kimi-k3Moonshot AI | 78.4% | Configuration par défaut de la source |
| 15 | grok-4.6xAI | 77.8% | Configuration par défaut de la source |
| 16 | grok-4.7-xhighxAI | 77.7% | xHigh « inférence » |
| 17 | smaug-agenticAbacus.AI | 77.7% | Configuration par défaut de la source |
| 18 | grok-4.5xAI | 77.2% | Configuration par défaut de la source |
| 20 | gpt-6-sol-maxOpenAI | 76.9% | Max « inférence » |
| 21 | qwen3.7-maxAlibaba | 76.9% | Configuration par défaut de la source |
| 22 | qwen3.8-maxAlibaba | 76.9% | Configuration par défaut de la source |
| 23 | muse-spark-1.2-xhighMeta | 76.4% | xHigh « inférence » |
| 24 | gpt-5.4-xhighOpenAI | 76.4% | xHigh « inférence » |
| 26 | claude-opus-5-max-effortAnthropic | 76.2% | Max « inférence » |
| 27 | claude-opus-5-5-max-effortAnthropic | 76.0% | Max « inférence » |
| 28 | qwen3.8-flash-nextAlibaba | 75.9% | Configuration par défaut de la source |
| 29 | claude-opus-4-8-max-effortAnthropic | 75.8% | Max « inférence » |
| 30 | deepseek-v4-flash-vision-expDeepSeek | 75.7% | Configuration par défaut de la source |
| 31 | deepseek-v4.1-flash-maxDeepSeek | 75.6% | Configuration par défaut de la source |
| 32 | smaug-miniAbacus.AI | 75.5% | Configuration par défaut de la source |
| 33 | deepseek-v4-pro-0813DeepSeek | 74.9% | Configuration par défaut de la source |
Limites de l'évaluation et attribution des données
La moyenne des deux mesure une performance combinée et ne peut pas être prise pour le score du seul Language. Sur la page officielle, les scores et le classement changent selon la catégorie sélectionnée ou l'inclusion de modèles affinés. L'organisation participante Abacus.AI développe aussi le modèle Smaug ; ses scores exclusifs doivent être complétés par d'autres sources indépendantes.
Licence des données :Apache 2.0
Les scores par catégorie sont publiés par LiveBench ; ce site les agrège à poids égal selon les deux catégories ci-dessus et les classe. Les échelles de score étant différentes, elles ne peuvent pas être additionnées directement ; le classement de référence utilise une échelle de référence fixe.