Arena WebDev
LMArena · Là aussi, sélection à l'aveugle par des humains : on compare l'ergonomie et la capacité de livraison des pages web.
Ce qu'il mesure, comment il le mesure
Lit les snapshots WebDev / Code Arena publiés officiellement, en conservant les modèles et configurations amont.
Comment utiliser ces preuves
Scores bruts conservés à titre de référence ; on n'a pas encore vérifié que tous les modèles suivent le même processus d'outils fixe, ils ne participent donc pas au classement des modèles sous-jacents.
Scores d'évaluation
Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.
| Rang sur le classement d'origine | Modèle au classement d'origine | Score brut | Configuration de référence |
|---|---|---|---|
| 1 | claude-opus-5.5-maxAnthropic | 1,815.4 | Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 2 | gpt-6-astra-maxOpenAI | 1,787.7 | Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 3 | claude-sonnet-5.5-xhighAnthropic | 1,786.3 | xHigh « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 4 | gpt-6.1-sol-maxOpenAI | 1,757.8 | Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 5 | claude-fable-5.1-maxAnthropic | 1,749.2 | Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 7 | claude-opus-5-maxAnthropic | 1,695 | Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 8 | gpt-6-sol-maxOpenAI | 1,689 | Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 9 | gemini-4-argon-highGoogle | 1,679.5 | High « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 10 | qwen3.8-maxAlibaba | 1,671.2 | Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 11 | qwen3.8-max-0902Alibaba | 1,670 | Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 13 | kimi-k3-maxMoonshot AI | 1,657.8 | Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 14 | muse-spark-1.3-maxMeta | 1,656.6 | Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 15 | grok-4.7-xhighxAI | 1,637.5 | xHigh « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 16 | qwen3.8-flash-nextAlibaba | 1,637.5 | Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 17 | hy4-previewTencent | 1,633.2 | Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 18 | claude-fable-5-highAnthropic | 1,625.3 | High « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 20 | glm-5.3-maxZ.ai | 1,623 | Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 21 | deepseek-v4.1-flash-maxDeepSeek | 1,619.9 | Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 22 | gpt-5.6-sol-xhigh (codex-harness)OpenAI | 1,619.8 | xHigh « inférence » · codex-harnessNon pris en compte :Cette configuration d'agent ne correspond à aucun flux d'outils unifié vérifié. |
| 23 | grok-4.6-highxAI | 1,619.5 | High « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 24 | mimo-v2.6-proXiaomi | 1,618.4 | Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 25 | glm-5.3-flashZ.ai | 1,615.6 | Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 26 | glm-5.2-maxZ.ai | 1,605 | Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 27 | gemini-3.7-flash-highGoogle | 1,591.7 | High « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 28 | qwen3.8-27bAlibaba | 1,591.2 | Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 29 | gemini-3.8-flash-highGoogle | 1,582.7 | High « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 30 | deepseek-v4-pro-high-20260813DeepSeek | 1,582.6 | Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 31 | deepseek-v4-flash-highDeepSeek | 1,581 | Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 32 | gpt-6-luna-maxOpenAI | 1,578.7 | Max « inférence »Non pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
| 33 | step-5-preview-highStepFun | 1,570.2 | Configuration par défaut de la sourceNon pris en compte :Les résultats de code incluent l'effet du système d'exécution ; la configuration mono-modèle unifiée n'a pas été vérifiée poste par poste, à titre indicatif uniquement. |
Limites de l'évaluation et attribution des données
Impossible d'attribuer directement au modèle sous-jacent les performances de livraison d'Agents spécialisés ou de processus d'exécution différents ; à réévaluer après vérification de l'étendue du protocole commun.
Licence des données :CC BY 4.0
Résultats publiés par LMArena ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.