Aller au contenu

EQ-Bench 4 · Émotions et compréhension interpersonnelle

EQ-Bench · Comprendre les émotions des personnages, les besoins implicites et les préférences de communication au fil d'échanges multi-tours.

Évaluation officielle
dans le Actu Créaflash surEn observation
Budget de preuvesHors classement
Date des données amontÀ confirmer
Dernière synchronisation réussieCollecte non commencée

Ce qu'il mesure, comment il le mesure

120 personnages simulés, 16 tours de jeu de rôle, évaluation à l'aveugle par trois modèles juges en rotation ; seul l'Elo est retenu, les traits de style comportemental ne comptent pas comme score de capacité (plus haut n'est pas mieux). L'ancienne v3 n'est pas recomptée.

Comment utiliser ces preuves

En observation : données publiques et licence disponibles, en attente d'une nouvelle campagne d'évaluation ; pas de prolongation de validité pour gonfler le nombre de sources par catégorie.

Limites de l'évaluation et attribution des données

Échanges simulés en anglais et non validés par des experts humains : ne peut être assimilé à la satisfaction d'une personne réelle ni à l'intelligence émotionnelle en chinois ; les scores actuels dépassent la fenêtre de 45 jours.

Licence des données :MIT · EQ-bench-site README déclaration de métadonnées

Résultats publiés par EQ-Bench ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.