Aller au contenu

Creative Writing v3

EQ-Bench · Création courte et expression

Évaluation officielle
dans le Actu Créaflash surClassé
Budget de preuves3.1%
Date des données amont09/24 15:57
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

CSV officiel intégré au script de données, avec Elo ; Sonnet 4.6 juge les vainqueurs, et le style, le taux de répétition et la rubric ne sont pas comptés à nouveau.

Comment utiliser ces preuves

Après vérification via le protocole mono-modèle, participe au classement de référence dans la limite de la part de la famille de questions du domaine de compétence concerné ; les mesures d'une même famille de questions n'augmentent pas la part totale de la famille. La part effective figure dans l'enregistrement de calcul en cours.

Scores d'évaluation

Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration de référence
1gpt-6-astraOpenAI2,173.3Configuration par défaut de la source
2claude-fable-5-1Anthropic2,162Configuration par défaut de la source
3claude-opus-5Anthropic2,132.6Configuration par défaut de la source
4gpt-6-solOpenAI2,124.7Configuration par défaut de la source
5kimi-k3Moonshot AI2,082.3Configuration par défaut de la source
6GLM-5.3Z.ai2,075Configuration par défaut de la source
7claude-opus-5-5Anthropic2,050.1Configuration par défaut de la source
8grok-4.7xAI2,006.7Configuration par défaut de la source
10gpt-5.6-solOpenAI1,971.6Configuration par défaut de la source
11claude-fable-5Anthropic1,943.1Configuration par défaut de la source
12aion-3.5aion-labs1,929.3Configuration par défaut de la source
13muse-spark-1.1Meta1,927.1Configuration par défaut de la source
14claude-opus-4-7Anthropic1,914.3Configuration par défaut de la source
15Altworld/Hemmingway-1其他1,906.4Configuration par défaut de la source
16muse-spark-1.3Meta1,905.9Configuration par défaut de la source
17gpt-5.6-terraOpenAI1,854.9Configuration par défaut de la source
18gpt-5.5OpenAI1,843.9Configuration par défaut de la source
19Qwen/Qwen3.8-2.4T-A95BAlibaba1,842.5Configuration par défaut de la source
20muse-spark-1.2Meta1,840.4Configuration par défaut de la source
21claude-opus-4-8Anthropic1,839.8Configuration par défaut de la source
22gpt-5.4OpenAI1,839.7Configuration par défaut de la source
23gpt-5.6-lunaOpenAI1,828.7Configuration par défaut de la source
24claude-sonnet-4-6Anthropic1,810.4Configuration par défaut de la source
25claude-opus-4-6Anthropic1,809.1Configuration par défaut de la source
26meta-models/Muse-Glimmer-30BMeta1,798.3Configuration par défaut de la source
27claude-sonnet-5Anthropic1,794Configuration par défaut de la source
28space-bunny-alphastealth1,784.3Configuration par défaut de la source
29zai-org/GLM-5.2Z.ai1,756.5Configuration par défaut de la source
30gemini-3.8-flashGoogle1,747.9Configuration par défaut de la source
31moonshotai/Kimi-K2.6Moonshot AI1,724.5Configuration par défaut de la source
Limites de l'évaluation et attribution des données

Principalement centré sur l'écriture en anglais et dépendant d'un juge modèle ; le même juge et les tâches associées partagent le budget, ce qui ne reflète pas le style d'écriture en chinois.

Licence des données :MIT · EQ-bench-site README déclaration de métadonnées

Résultats publiés par EQ-Bench ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.