Aller au contenu

Arena Text Style-Controlled

LMArena · Des humains comparent anonymement des réponses par paires, pour voir laquelle ils préfèrent lire. Complète l'expérience globale que les QCM ne montrent pas.

Évaluation officielle
dans le Actu Créaflash surRéférence croisée
Budget de preuvesHors classement
Date des données amont10/02 08:00
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

Ne prend que le classement principal Text Overall style-controlled des snapshots publiés officiellement, sans scraper arena.ai la page en temps réel.

Comment utiliser ces preuves

Le classement texte global sert uniquement de référence croisée ; la catégorie création étant déjà utilisée à part, plus aucun vote global n'est ajouté.

Scores d'évaluation

Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration de référence
1gemini-4-argon-highGoogle1,525.2High « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
2claude-opus-4-6-highAnthropic1,504.7High « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
3claude-fable-5-highAnthropic1,504.3High « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
4claude-opus-5.5-highAnthropic1,503.7High « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
5claude-opus-4-7-highAnthropic1,501.3High « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
6claude-fable-5.1-maxAnthropic1,501.1Max « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
8gemini-3.8-flash-highGoogle1,494.8High « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
9muse-spark-1.3-maxMeta1,494.3Max « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
11muse-spark-1.2 (xHigh)Meta1,493.5xHigh « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
12muse-spark-1.1Meta1,491.3Configuration par défaut de la sourceNon pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
14claude-opus-5-maxAnthropic1,489.5Max « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
15muse-sparkMeta1,489.3Configuration par défaut de la sourceNon pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
16kimi-k3-maxMoonshot AI1,488.4Configuration par défaut de la sourceNon pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
17gemini-3.7-flash-highGoogle1,487.7High « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
18gemini-3.1-pro-previewGoogle1,487Configuration par défaut de la sourceNon pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
19gemini-3-proGoogle1,485.5Configuration par défaut de la sourceNon pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
20gpt-5.6-sol-xhighOpenAI1,483.9xHigh « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
21gpt-6.1-sol-maxOpenAI1,483.2Max « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
22gemini-3.6-flash-highGoogle1,483High « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
23qwen3.8-maxAlibaba1,481.6Configuration par défaut de la sourceNon pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
24claude-opus-4-8-highAnthropic1,481.5High « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
25gpt-5.5-highOpenAI1,481.4High « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
26mimo-v2.6-proXiaomi1,480.1Configuration par défaut de la sourceNon pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
27glm-5.3-maxZ.ai1,478.5Configuration par défaut de la sourceNon pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
28gemini-3.5-flash-highGoogle1,477.4High « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
29gpt-6-astra-maxOpenAI1,477.1Max « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
32glm-5.2-maxZ.ai1,475.8Configuration par défaut de la sourceNon pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
33gpt-5.2-chat-latest-20260210OpenAI1,475.7Configuration par défaut de la sourceNon pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
34gpt-5.4-highOpenAI1,475.2High « inférence »Non pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
35qwen3.7-max-previewAlibaba1,474.9Configuration par défaut de la sourceNon pris en compte :La préférence textuelle globale est un résultat composite ; elle sert uniquement au recoupement et n'est pas comptée en double avec les résultats détaillés.
Limites de l'évaluation et attribution des données

Les préférences humaines dépendent du style, de la structure des utilisateurs et de la distribution des prompts ; le classement global et les catégories se recoupent.

Licence des données :CC BY 4.0

Résultats publiés par LMArena ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.