EQ-Bench 4 · Émotions et compréhension interpersonnelle
EQ-Bench · Comprendre les émotions des personnages, les besoins implicites et les préférences de communication au fil d'échanges multi-tours.
Ce qu'il mesure, comment il le mesure
120 personnages simulés, 16 tours de jeu de rôle, évaluation à l'aveugle par trois modèles juges en rotation ; seul l'Elo est retenu, les traits de style comportemental ne comptent pas comme score de capacité (plus haut n'est pas mieux). L'ancienne v3 n'est pas recomptée.
Comment utiliser ces preuves
En observation : données publiques et licence disponibles, en attente d'une nouvelle campagne d'évaluation ; pas de prolongation de validité pour gonfler le nombre de sources par catégorie.
Limites de l'évaluation et attribution des données
Échanges simulés en anglais et non validés par des experts humains : ne peut être assimilé à la satisfaction d'une personne réelle ni à l'intelligence émotionnelle en chinois ; les scores actuels dépassent la fenêtre de 45 jours.
Licence des données :MIT · EQ-bench-site README déclaration de métadonnées
Résultats publiés par EQ-Bench ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.