Aller au contenu

Longform Writing

EQ-Bench · Cohérence et complétude de longs récits

Évaluation officielle
dans le Actu Créaflash surClassé
Budget de preuves3.1%
Date des données amont09/24 15:57
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

Utilise le score overall_score_100 ;Note de l'intrigue et de l'expression d'un texte long en huit chapitres, les préférences du juge étant signalées comme limite.

Comment utiliser ces preuves

Après vérification via le protocole mono-modèle, participe au classement de référence dans la limite de la part de la famille de questions du domaine de compétence concerné ; les mesures d'une même famille de questions n'augmentent pas la part totale de la famille. La part effective figure dans l'enregistrement de calcul en cours.

Scores d'évaluation

Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration de référence
1claude-opus-5Anthropic86.3Configuration par défaut de la source
2claude-fable-5-1Anthropic85.3Configuration par défaut de la source
3claude-opus-5-5Anthropic84.6Configuration par défaut de la source
4grok-4.7xAI83Configuration par défaut de la source
4claude-fable-5Anthropic83Configuration par défaut de la source
6gpt-6-solOpenAI82.8Configuration par défaut de la source
6muse-spark-1.3Meta82.8Configuration par défaut de la source
6gpt-6-astraOpenAI82.8Configuration par défaut de la source
9aion-3.5aion-labs82.1Configuration par défaut de la source
10GLM-5.3Z.ai81.8Configuration par défaut de la source
10claude-opus-4-7Anthropic81.8Configuration par défaut de la source
12gpt-5.6-solOpenAI81.7Configuration par défaut de la source
13muse-spark-1.2Meta81.5Configuration par défaut de la source
14claude-opus-4-8Anthropic80.8Configuration par défaut de la source
15claude-sonnet-4-6Anthropic79.9Configuration par défaut de la source
17kimi-k3Moonshot AI79.6Configuration par défaut de la source
18moonshotai/Kimi-K2.6Moonshot AI78.5Configuration par défaut de la source
19gpt-5.4OpenAI78.3Configuration par défaut de la source
19claude-sonnet-5Anthropic78.3Configuration par défaut de la source
21gpt-5.5OpenAI78.2Configuration par défaut de la source
22gpt-5.6-terraOpenAI78Configuration par défaut de la source
23zai-org/GLM-5.2Z.ai77.9Configuration par défaut de la source
24claude-opus-4-6Anthropic77.7Configuration par défaut de la source
25gemini-3.8-flashGoogle76.8Configuration par défaut de la source
26deepseek-ai/DeepSeek-V4-ProDeepSeek75.6Configuration par défaut de la source
27gpt-5.6-lunaOpenAI75.5Configuration par défaut de la source
28moonshotai/Kimi-K2.5Moonshot AI74.9Configuration par défaut de la source
29Altworld/Hemmingway-1其他74.2Configuration par défaut de la source
30deepseek-v4.1-flashDeepSeek74Configuration par défaut de la source
31XiaomiMiMo/MiMo-V2.5-ProXiaomi73.7Configuration par défaut de la source
Limites de l'évaluation et attribution des données

Principalement centré sur l'écriture en anglais et dépendant d'un juge modèle ; le même juge et les tâches associées partagent le budget, ce qui ne reflète pas le style d'écriture en chinois.

Licence des données :MIT · EQ-bench-site README déclaration de métadonnées

Résultats publiés par EQ-Bench ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.