Arena Creative Writing
LMArena · Des humains évaluent à l'aveugle histoires, poèmes et autres expressions créatives, pour voir si l'œuvre captive les lecteurs.
Ce qu'il mesure, comment il le mesure
Lit le jeu de données officiel text_style_control de la catégorie creative_writing , en adoptant après contrôle du style les scores Bradley–Terry et intervalles de confiance ; sans emprunter les scores du classement texte global ni de la catégorie rédaction professionnelle.
Comment utiliser ces preuves
Après vérification via le protocole mono-modèle, participe au classement de référence dans la limite de la part de la famille de questions du domaine de compétence concerné ; les mesures d'une même famille de questions n'augmentent pas la part totale de la famille. La part effective figure dans l'enregistrement de calcul en cours.
Scores d'évaluation
Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.
| Rang sur le classement d'origine | Modèle au classement d'origine | Score brut | Configuration de référence |
|---|---|---|---|
| 1 | gemini-4-argon-highGoogle | 1,518.8 | High « inférence » |
| 2 | claude-opus-5.5-highAnthropic | 1,516.3 | High « inférence » |
| 3 | claude-fable-5-highAnthropic | 1,502.6 | High « inférence » |
| 4 | claude-opus-4-6-highAnthropic | 1,500.8 | High « inférence » |
| 5 | gemini-3.7-flash-highGoogle | 1,493.4 | High « inférence » |
| 6 | claude-opus-4-7-highAnthropic | 1,489 | High « inférence » |
| 7 | gemini-3.8-flash-highGoogle | 1,484.5 | High « inférence » |
| 8 | gemini-3-proGoogle | 1,484.4 | Configuration par défaut de la source |
| 10 | claude-fable-5.1-maxAnthropic | 1,481.8 | Max « inférence » |
| 11 | gemini-3.1-pro-previewGoogle | 1,480.3 | Configuration par défaut de la source |
| 14 | gemini-3.6-flash-highGoogle | 1,470.9 | High « inférence » |
| 15 | claude-opus-5-maxAnthropic | 1,470.6 | Max « inférence » |
| 16 | claude-opus-4-5-20251101-high-32kAnthropic | 1,469.5 | High « inférence » · 32k |
| 17 | claude-opus-4-8-highAnthropic | 1,469.5 | High « inférence » |
| 19 | gpt-5.6-sol-xhighOpenAI | 1,468.3 | xHigh « inférence » |
| 20 | qwen3.8-maxAlibaba | 1,467.9 | Configuration par défaut de la source |
| 21 | muse-sparkMeta | 1,465.5 | Configuration par défaut de la source |
| 22 | gemini-3.5-flash-highGoogle | 1,463.9 | High « inférence » |
| 24 | grok-4.20-beta1xAI | 1,463 | Configuration par défaut de la source |
| 26 | kimi-k3-maxMoonshot AI | 1,460.2 | Configuration par défaut de la source |
| 27 | gpt-6.1-sol-maxOpenAI | 1,459.7 | Max « inférence » |
| 28 | muse-spark-1.3-maxMeta | 1,458.7 | Max « inférence » |
| 29 | gemini-3-flashGoogle | 1,456.8 | Configuration par défaut de la source |
| 30 | gpt-5.5-instantOpenAI | 1,456.4 | Configuration par défaut de la source |
| 31 | muse-spark-1.2 (xHigh)Meta | 1,455.5 | xHigh « inférence » |
| 32 | glm-5.2-maxZ.ai | 1,454.2 | Configuration par défaut de la source |
| 34 | glm-5.3-maxZ.ai | 1,453.9 | Configuration par défaut de la source |
| 35 | gpt-5.5-highOpenAI | 1,451.3 | High « inférence » |
| 36 | grok-4.5xAI | 1,450.2 | Configuration par défaut de la source |
| 37 | claude-sonnet-4-5-20250929-high-32kAnthropic | 1,450 | High « inférence » · 32k |
Limites de l'évaluation et attribution des données
Les prompts utilisateurs ouverts sont classés par un classificateur ; tous ne sont pas des romans longs ou de la création en chinois ; les votes comportent des préférences personnelles. Recoupement avec le classement texte global et la catégorie rédaction professionnelle d'Arena : ne peut pas compter comme entité indépendante supplémentaire.
Licence des données :CC BY 4.0 · Arena jeu de données officiel Hugging Face leaderboard ; conserver l'attribution, les liens vers la source et préciser les modifications d'agrégation.
Résultats publiés par LMArena ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.