Humanity’s Last Exam
CAIS / Scale AI / Connaissance · Connaissances académiques et raisonnement de haut niveau, toutes disciplines confondues.
Ce qu'il mesure, comment il le mesure
Jeu de questions, conditions d'outillage et juge figés ; HLE, HLE-Rolling et les résultats avec outils sont comparés séparément. AA v4.3 inclut déjà HLE ; si des scores spécialisés exploitables deviennent disponibles, ils ne serviront qu'à la classification, sans double comptage dans le classement global.
Comment utiliser ces preuves
En observation : des ajouts officiels de nouveaux produits, mais les scores bruts restent sans date d'évaluation vérifiable ; on n'applique pas la licence des données auto-évaluées d'Epoch et l'on ne revalorise pas des preuves globales AA déjà prises en compte.
Limites de l'évaluation et attribution des données
En observation : des ajouts officiels de nouveaux produits, mais les scores bruts restent sans date d'évaluation vérifiable ; on n'applique pas la licence des données auto-évaluées d'Epoch et l'on ne revalorise pas des preuves globales AA déjà prises en compte.
Licence des données :Code d'évaluation sous MIT ; les limites de rediffusion des scores du classement officiel restent à confirmer.
Résultats publiés par CAIS / Scale AI ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.