Creative Writing v3
EQ-Bench · Création courte et expression
Ce qu'il mesure, comment il le mesure
CSV officiel intégré au script de données, avec Elo ; Sonnet 4.6 juge les vainqueurs, et le style, le taux de répétition et la rubric ne sont pas comptés à nouveau.
Comment utiliser ces preuves
Après vérification via le protocole mono-modèle, participe au classement de référence dans la limite de la part de la famille de questions du domaine de compétence concerné ; les mesures d'une même famille de questions n'augmentent pas la part totale de la famille. La part effective figure dans l'enregistrement de calcul en cours.
Scores d'évaluation
Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.
| Rang sur le classement d'origine | Modèle au classement d'origine | Score brut | Configuration de référence |
|---|---|---|---|
| 1 | gpt-6-astraOpenAI | 2,173.3 | Configuration par défaut de la source |
| 2 | claude-fable-5-1Anthropic | 2,162 | Configuration par défaut de la source |
| 3 | claude-opus-5Anthropic | 2,132.6 | Configuration par défaut de la source |
| 4 | gpt-6-solOpenAI | 2,124.7 | Configuration par défaut de la source |
| 5 | kimi-k3Moonshot AI | 2,082.3 | Configuration par défaut de la source |
| 6 | GLM-5.3Z.ai | 2,075 | Configuration par défaut de la source |
| 7 | claude-opus-5-5Anthropic | 2,050.1 | Configuration par défaut de la source |
| 8 | grok-4.7xAI | 2,006.7 | Configuration par défaut de la source |
| 10 | gpt-5.6-solOpenAI | 1,971.6 | Configuration par défaut de la source |
| 11 | claude-fable-5Anthropic | 1,943.1 | Configuration par défaut de la source |
| 12 | aion-3.5aion-labs | 1,929.3 | Configuration par défaut de la source |
| 13 | muse-spark-1.1Meta | 1,927.1 | Configuration par défaut de la source |
| 14 | claude-opus-4-7Anthropic | 1,914.3 | Configuration par défaut de la source |
| 15 | Altworld/Hemmingway-1其他 | 1,906.4 | Configuration par défaut de la source |
| 16 | muse-spark-1.3Meta | 1,905.9 | Configuration par défaut de la source |
| 17 | gpt-5.6-terraOpenAI | 1,854.9 | Configuration par défaut de la source |
| 18 | gpt-5.5OpenAI | 1,843.9 | Configuration par défaut de la source |
| 19 | Qwen/Qwen3.8-2.4T-A95BAlibaba | 1,842.5 | Configuration par défaut de la source |
| 20 | muse-spark-1.2Meta | 1,840.4 | Configuration par défaut de la source |
| 21 | claude-opus-4-8Anthropic | 1,839.8 | Configuration par défaut de la source |
| 22 | gpt-5.4OpenAI | 1,839.7 | Configuration par défaut de la source |
| 23 | gpt-5.6-lunaOpenAI | 1,828.7 | Configuration par défaut de la source |
| 24 | claude-sonnet-4-6Anthropic | 1,810.4 | Configuration par défaut de la source |
| 25 | claude-opus-4-6Anthropic | 1,809.1 | Configuration par défaut de la source |
| 26 | meta-models/Muse-Glimmer-30BMeta | 1,798.3 | Configuration par défaut de la source |
| 27 | claude-sonnet-5Anthropic | 1,794 | Configuration par défaut de la source |
| 28 | space-bunny-alphastealth | 1,784.3 | Configuration par défaut de la source |
| 29 | zai-org/GLM-5.2Z.ai | 1,756.5 | Configuration par défaut de la source |
| 30 | gemini-3.8-flashGoogle | 1,747.9 | Configuration par défaut de la source |
| 31 | moonshotai/Kimi-K2.6Moonshot AI | 1,724.5 | Configuration par défaut de la source |
Limites de l'évaluation et attribution des données
Principalement centré sur l'écriture en anglais et dépendant d'un juge modèle ; le même juge et les tâches associées partagent le budget, ce qui ne reflète pas le style d'écriture en chinois.
Licence des données :MIT · EQ-bench-site README déclaration de métadonnées
Résultats publiés par EQ-Bench ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.