Aller au contenu

Arena WebDev

LMArena · Là aussi, sélection à l'aveugle par des humains : on compare l'ergonomie et la capacité de livraison des pages web.

Évaluation officielle
dans le Actu Créaflash surÀ titre indicatif
Budget de preuvesHors classement
Date des données amont10/01 08:00
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

Lit les snapshots WebDev / Code Arena publiés officiellement, en conservant les modèles et configurations amont.

Comment utiliser ces preuves

Scores bruts conservés à titre de référence ; on n'a pas encore vérifié que tous les modèles suivent le même processus d'outils fixe, ils ne participent donc pas au classement des modèles sous-jacents.

Scores d'évaluation

Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration de référence
1claude-opus-5.5-maxAnthropic1,815.4Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
2gpt-6-astra-maxOpenAI1,787.7Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
3claude-sonnet-5.5-xhighAnthropic1,786.3xHigh « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
4gpt-6.1-sol-maxOpenAI1,757.8Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
5claude-fable-5.1-maxAnthropic1,749.2Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
7claude-opus-5-maxAnthropic1,695Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
8gpt-6-sol-maxOpenAI1,689Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
9gemini-4-argon-highGoogle1,679.5High « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
10qwen3.8-maxAlibaba1,671.2Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
11qwen3.8-max-0902Alibaba1,670Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
13kimi-k3-maxMoonshot AI1,657.8Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
14muse-spark-1.3-maxMeta1,656.6Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
15grok-4.7-xhighxAI1,637.5xHigh « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
16qwen3.8-flash-nextAlibaba1,637.5Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
17hy4-previewTencent1,633.2Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
18claude-fable-5-highAnthropic1,625.3High « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
20glm-5.3-maxZ.ai1,623Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
21deepseek-v4.1-flash-maxDeepSeek1,619.9Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
22gpt-5.6-sol-xhigh (codex-harness)OpenAI1,619.8xHigh « inférence » · codex-harnessNon pris en compte :Cette configuration d'agent ne correspond à aucun flux d'outils unifié vérifié.
23grok-4.6-highxAI1,619.5High « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
24mimo-v2.6-proXiaomi1,618.4Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
25glm-5.3-flashZ.ai1,615.6Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
26glm-5.2-maxZ.ai1,605Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
27gemini-3.7-flash-highGoogle1,591.7High « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
28qwen3.8-27bAlibaba1,591.2Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
29gemini-3.8-flash-highGoogle1,582.7High « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
30deepseek-v4-pro-high-20260813DeepSeek1,582.6Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
31deepseek-v4-flash-highDeepSeek1,581Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
32gpt-6-luna-maxOpenAI1,578.7Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
33step-5-preview-highStepFun1,570.2Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement.
Limites de l'évaluation et attribution des données

Impossible d'attribuer directement au modèle sous-jacent les performances de livraison d'Agents spécialisés ou de processus d'exécution différents ; à réévaluer après vérification de l'étendue du protocole commun.

Licence des données :CC BY 4.0

Résultats publiés par LMArena ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.