Aller au contenu

Arena Creative Writing

LMArena · Des humains évaluent à l'aveugle histoires, poèmes et autres expressions créatives, pour voir si l'œuvre captive les lecteurs.

Évaluation officielle
dans le Actu Créaflash surClassé
Budget de preuves6.3%
Date des données amont10/02 08:00
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

Lit le jeu de données officiel text_style_control de la catégorie creative_writing , en adoptant après contrôle du style les scores Bradley–Terry et intervalles de confiance ; sans emprunter les scores du classement texte global ni de la catégorie rédaction professionnelle.

Comment utiliser ces preuves

Après vérification via le protocole mono-modèle, participe au classement de référence dans la limite de la part de la famille de questions du domaine de compétence concerné ; les mesures d'une même famille de questions n'augmentent pas la part totale de la famille. La part effective figure dans l'enregistrement de calcul en cours.

Scores d'évaluation

Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration de référence
1gemini-4-argon-highGoogle1,518.8High « inférence »
2claude-opus-5.5-highAnthropic1,516.3High « inférence »
3claude-fable-5-highAnthropic1,502.6High « inférence »
4claude-opus-4-6-highAnthropic1,500.8High « inférence »
5gemini-3.7-flash-highGoogle1,493.4High « inférence »
6claude-opus-4-7-highAnthropic1,489High « inférence »
7gemini-3.8-flash-highGoogle1,484.5High « inférence »
8gemini-3-proGoogle1,484.4Configuration par défaut de la source
10claude-fable-5.1-maxAnthropic1,481.8Max « inférence »
11gemini-3.1-pro-previewGoogle1,480.3Configuration par défaut de la source
14gemini-3.6-flash-highGoogle1,470.9High « inférence »
15claude-opus-5-maxAnthropic1,470.6Max « inférence »
16claude-opus-4-5-20251101-high-32kAnthropic1,469.5High « inférence » · 32k
17claude-opus-4-8-highAnthropic1,469.5High « inférence »
19gpt-5.6-sol-xhighOpenAI1,468.3xHigh « inférence »
20qwen3.8-maxAlibaba1,467.9Configuration par défaut de la source
21muse-sparkMeta1,465.5Configuration par défaut de la source
22gemini-3.5-flash-highGoogle1,463.9High « inférence »
24grok-4.20-beta1xAI1,463Configuration par défaut de la source
26kimi-k3-maxMoonshot AI1,460.2Configuration par défaut de la source
27gpt-6.1-sol-maxOpenAI1,459.7Max « inférence »
28muse-spark-1.3-maxMeta1,458.7Max « inférence »
29gemini-3-flashGoogle1,456.8Configuration par défaut de la source
30gpt-5.5-instantOpenAI1,456.4Configuration par défaut de la source
31muse-spark-1.2 (xHigh)Meta1,455.5xHigh « inférence »
32glm-5.2-maxZ.ai1,454.2Configuration par défaut de la source
34glm-5.3-maxZ.ai1,453.9Configuration par défaut de la source
35gpt-5.5-highOpenAI1,451.3High « inférence »
36grok-4.5xAI1,450.2Configuration par défaut de la source
37claude-sonnet-4-5-20250929-high-32kAnthropic1,450High « inférence » · 32k
Limites de l'évaluation et attribution des données

Les prompts utilisateurs ouverts sont classés par un classificateur ; tous ne sont pas des romans longs ou de la création en chinois ; les votes comportent des préférences personnelles. Recoupement avec le classement texte global et la catégorie rédaction professionnelle d'Arena : ne peut pas compter comme entité indépendante supplémentaire.

Licence des données :CC BY 4.0 · Arena jeu de données officiel Hugging Face leaderboard ; conserver l'attribution, les liens vers la source et préciser les modifications d'agrégation.

Résultats publiés par LMArena ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.