Aller au contenu

Humanity’s Last Exam

CAIS / Scale AI / Connaissance · Connaissances académiques et raisonnement de haut niveau, toutes disciplines confondues.

Évaluation officielle
dans le Actu Créaflash surEn observation
Budget de preuvesHors classement
Date des données amontÀ confirmer
Dernière synchronisation réussieCollecte non commencée

Ce qu'il mesure, comment il le mesure

Jeu de questions, conditions d'outillage et juge figés ; HLE, HLE-Rolling et les résultats avec outils sont comparés séparément. AA v4.3 inclut déjà HLE ; si des scores spécialisés exploitables deviennent disponibles, ils ne serviront qu'à la classification, sans double comptage dans le classement global.

Comment utiliser ces preuves

En observation : des ajouts officiels de nouveaux produits, mais les scores bruts restent sans date d'évaluation vérifiable ; on n'applique pas la licence des données auto-évaluées d'Epoch et l'on ne revalorise pas des preuves globales AA déjà prises en compte.

Limites de l'évaluation et attribution des données

En observation : des ajouts officiels de nouveaux produits, mais les scores bruts restent sans date d'évaluation vérifiable ; on n'applique pas la licence des données auto-évaluées d'Epoch et l'on ne revalorise pas des preuves globales AA déjà prises en compte.

Licence des données :Code d'évaluation sous MIT ; les limites de rediffusion des scores du classement officiel restent à confirmer.

Résultats publiés par CAIS / Scale AI ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.