Aller au contenu

LiveBench · Programmation générale

LiveBench / programmation · Coding + Agentic Coding Moyenne des deux, à 50 % chacun.

Évaluation officielle
dans le Actu Créaflash surClassé
Budget de preuves8.3%
Date des données amont09/30 03:01
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

Lecture des sous-scores non arrondis de Coding et Agentic Coding. La programmation directe et la programmation avec outils unifiés entrent séparément dans le calcul ; cette page source conserve la moyenne des deux, la page modèle affichant aussi les sous-scores.

Comment utiliser ces preuves

La programmation directe et la programmation avec outils sont comparées séparément selon différentes familles de tâches, toutes deux relevant du domaine de la programmation ; leur moyenne n'est pas recomptée.

Scores d'évaluation

Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration de référence
1claude-opus-5-5-max-effortAnthropic80.5%Max « inférence »
2deepseek-v4.1-flash-maxDeepSeek78.7%Configuration par défaut de la source
4claude-fable-5-1-max-effortAnthropic76.2%Max « inférence »
5claude-fable-5-max-effortAnthropic74.1%Max « inférence »
6claude-sonnet-5-5-max-effortAnthropic73.8%Max « inférence »
7smaug-agenticAbacus.AI73.6%Configuration par défaut de la source
8claude-opus-5-max-effortAnthropic73.3%Max « inférence »
9muse-spark-1.3-xhighMeta72.6%xHigh « inférence »
10kimi-k3Moonshot AI71.8%Configuration par défaut de la source
11gpt-5.6-sol-maxOpenAI70.1%Max « inférence »
12claude-sonnet-5-xhigh-effortAnthropic70.0%xHigh « inférence »
13glm-5.3Z.ai69.9%Configuration par défaut de la source
14smaug-flashAbacus.AI69.1%Configuration par défaut de la source
15gpt-6-astra-maxOpenAI68.8%Max « inférence »
16qwen3.8-maxAlibaba68.8%Configuration par défaut de la source
18gemini-3.7-flash-highGoogle68.6%High « inférence »
19qwen3.8-27bAlibaba68.5%Configuration par défaut de la source
20smaug-miniAbacus.AI68.1%Configuration par défaut de la source
21gpt-5.5-xhighOpenAI68.1%xHigh « inférence »
22glm-5.3-flashZ.ai67.9%Configuration par défaut de la source
23muse-spark-1.1-xhighMeta67.8%xHigh « inférence »
24muse-spark-1.2-xhighMeta67.6%xHigh « inférence »
25gpt-6.1-sol-maxOpenAI67.5%Max « inférence »
26gpt-6-sol-maxOpenAI67.3%Max « inférence »
27qwen3.8-flash-nextAlibaba67.1%Configuration par défaut de la source
28grok-4.6xAI66.9%Configuration par défaut de la source
29deepseek-v4-flash-vision-expDeepSeek66.7%Configuration par défaut de la source
30gpt-5.6-terra-maxOpenAI66.6%Max « inférence »
31gpt-5.2-codexOpenAI66.5%Configuration par défaut de la source
32claude-opus-4-7-xhigh-effortAnthropic66.4%xHigh « inférence »
Limites de l'évaluation et attribution des données

La moyenne des deux mesure une performance combinée et ne peut pas être prise pour un score Coding isolé. Lorsque la page officielle change de catégorie ou inclut ou non des modèles affinés, les scores et le classement changent en conséquence. L'organisation participante Abacus.AI développe aussi le modèle Smaug ; ses scores exclusifs doivent être complétés par d'autres sources indépendantes.

Licence des données :Apache 2.0

Les scores par catégorie sont publiés par LiveBench ; ce site les agrège à poids égal selon les deux catégories ci-dessus et les classe. Les échelles de score étant différentes, elles ne peuvent pas être additionnées directement ; le classement de référence utilise une échelle de référence fixe.