Aller au contenu

LiveBench · Langage et instructions

LiveBench · Language + IF Moyenne des deux, à 50 % chacun.

Évaluation officielle
dans le Actu Créaflash surClassé
Budget de preuves12.5%
Date des données amont09/30 03:01
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

Calculer d'abord séparément les scores par catégorie Language et IF, puis en faire la moyenne à 50 % chacun, en arrondissant à une décimale. Cette moyenne des deux diffère du score obtenu en sélectionnant une seule catégorie sur le site officiel. Language mesure la compréhension linguistique, IF mesure le respect des instructions et des contraintes de format ; elle ne permet pas de juger le style d'écriture romanesque.

Comment utiliser ces preuves

Après vérification via le protocole mono-modèle, participe au classement de référence dans la limite de la part de la famille de questions du domaine de compétence concerné ; les mesures d'une même famille de questions n'augmentent pas la part totale de la famille. La part effective figure dans l'enregistrement de calcul en cours.

Scores d'évaluation

Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration de référence
1gemini-3.8-flash-highGoogle84.6%High « inférence »
2claude-fable-5-max-effortAnthropic83.2%Max « inférence »
3gemini-3.7-flash-highGoogle82.7%High « inférence »
4gpt-6-astra-maxOpenAI82.5%Max « inférence »
5gemini-3.1-pro-preview-highGoogle82.2%High « inférence »
6gpt-6.1-sol-maxOpenAI82.1%Max « inférence »
7claude-fable-5-1-max-effortAnthropic81.2%Max « inférence »
8muse-spark-1.3-xhighMeta80.4%xHigh « inférence »
9gemini-3.5-flash-highGoogle80.1%High « inférence »
11gpt-5.6-sol-maxOpenAI79.8%Max « inférence »
12gemini-3.6-flash-highGoogle79.6%High « inférence »
13gpt-5.5-xhighOpenAI79.0%xHigh « inférence »
14kimi-k3Moonshot AI78.4%Configuration par défaut de la source
15grok-4.6xAI77.8%Configuration par défaut de la source
16grok-4.7-xhighxAI77.7%xHigh « inférence »
17smaug-agenticAbacus.AI77.7%Configuration par défaut de la source
18grok-4.5xAI77.2%Configuration par défaut de la source
20gpt-6-sol-maxOpenAI76.9%Max « inférence »
21qwen3.7-maxAlibaba76.9%Configuration par défaut de la source
22qwen3.8-maxAlibaba76.9%Configuration par défaut de la source
23muse-spark-1.2-xhighMeta76.4%xHigh « inférence »
24gpt-5.4-xhighOpenAI76.4%xHigh « inférence »
26claude-opus-5-max-effortAnthropic76.2%Max « inférence »
27claude-opus-5-5-max-effortAnthropic76.0%Max « inférence »
28qwen3.8-flash-nextAlibaba75.9%Configuration par défaut de la source
29claude-opus-4-8-max-effortAnthropic75.8%Max « inférence »
30deepseek-v4-flash-vision-expDeepSeek75.7%Configuration par défaut de la source
31deepseek-v4.1-flash-maxDeepSeek75.6%Configuration par défaut de la source
32smaug-miniAbacus.AI75.5%Configuration par défaut de la source
33deepseek-v4-pro-0813DeepSeek74.9%Configuration par défaut de la source
Limites de l'évaluation et attribution des données

La moyenne des deux mesure une performance combinée et ne peut pas être prise pour le score du seul Language. Sur la page officielle, les scores et le classement changent selon la catégorie sélectionnée ou l'inclusion de modèles affinés. L'organisation participante Abacus.AI développe aussi le modèle Smaug ; ses scores exclusifs doivent être complétés par d'autres sources indépendantes.

Licence des données :Apache 2.0

Les scores par catégorie sont publiés par LiveBench ; ce site les agrège à poids égal selon les deux catégories ci-dessus et les classe. Les échelles de score étant différentes, elles ne peuvent pas être additionnées directement ; le classement de référence utilise une échelle de référence fixe.