Aller au contenu

LiveBench · Raisonnement et mathématiques

LiveBench / « inférence » · Reasoning + Mathematics Moyenne des deux, à 50 % chacun.

Évaluation officielle
dans le Actu Créaflash surClassé
Budget de preuves3.1%
Date des données amont09/30 03:01
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

Calculer d'abord séparément les scores par catégorie Reasoning et Mathematics, puis faire la moyenne à 50 % chacune et arrondir à une décimale. Cette moyenne des deux diffère du score obtenu en sélectionnant une seule catégorie sur le site officiel.

Comment utiliser ces preuves

Après vérification via le protocole mono-modèle, participe au classement de référence dans la limite de la part de la famille de questions du domaine de compétence concerné ; les mesures d'une même famille de questions n'augmentent pas la part totale de la famille. La part effective figure dans l'enregistrement de calcul en cours.

Scores d'évaluation

Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration de référence
1gpt-6.1-sol-maxOpenAI94.7%Max « inférence »
2gpt-6-astra-maxOpenAI94.7%Max « inférence »
3claude-opus-5-5-max-effortAnthropic94.6%Max « inférence »
4claude-fable-5-1-max-effortAnthropic94.3%Max « inférence »
6gpt-5.6-sol-maxOpenAI93.9%Max « inférence »
7claude-sonnet-5-5-max-effortAnthropic93.9%Max « inférence »
9claude-opus-5-max-effortAnthropic93.5%Max « inférence »
10claude-fable-5-max-effortAnthropic92.8%Max « inférence »
11muse-spark-1.3-xhighMeta92.8%xHigh « inférence »
12gpt-5.6-terra-maxOpenAI92.8%Max « inférence »
13gpt-5.5-xhighOpenAI92.8%xHigh « inférence »
14gpt-6-sol-maxOpenAI92.5%Max « inférence »
15claude-opus-4-8-max-effortAnthropic91.8%Max « inférence »
17grok-4.6xAI91.5%Configuration par défaut de la source
18gpt-5.4-xhighOpenAI91.1%xHigh « inférence »
19claude-sonnet-5-xhigh-effortAnthropic90.8%xHigh « inférence »
20gemini-3.7-flash-highGoogle90.6%High « inférence »
21muse-spark-1.2-xhighMeta90.6%xHigh « inférence »
22deepseek-v4-pro-0813DeepSeek90.5%Configuration par défaut de la source
23gemini-3.8-flash-highGoogle90.4%High « inférence »
24claude-opus-4-7-xhigh-effortAnthropic90.0%xHigh « inférence »
25deepseek-v4.1-flash-maxDeepSeek90.0%Configuration par défaut de la source
26qwen3.8-maxAlibaba89.8%Configuration par défaut de la source
27grok-4.7-xhighxAI89.2%xHigh « inférence »
28grok-4.5xAI89.0%Configuration par défaut de la source
29claude-opus-4-6-thinking-auto-high-effortAnthropic89.0%High « inférence »
30gpt-5.2-2025-12-11-highOpenAI88.2%High « inférence »
31smaug-flashAbacus.AI88.1%Configuration par défaut de la source
32kimi-k3Moonshot AI87.6%Configuration par défaut de la source
33gemini-3.1-pro-preview-highGoogle87.5%High « inférence »
Limites de l'évaluation et attribution des données

La moyenne des deux mesure la performance combinée et ne doit pas être prise pour le score Reasoning seul. Sur la page officielle, changer de catégorie ou inclure ou non les modèles affinés fait varier les scores et le classement. L'organisation participante Abacus.AI développe aussi le modèle Smaug ; ses scores exclusifs doivent être complétés par d'autres sources indépendantes.

Licence des données :Apache 2.0

Les scores par catégorie sont publiés par LiveBench ; ce site les agrège à poids égal selon les deux catégories ci-dessus et les classe. Les échelles de score étant différentes, elles ne peuvent pas être additionnées directement ; le classement de référence utilise une échelle de référence fixe.