FACTS Parametric
Google DeepMind / Kaggle / Connaissance · Répondre à des questions factuelles sur le monde sans outil de recherche, pour tester l'exactitude des connaissances du modèle.
Ce qu'il mesure, comment il le mesure
Ne considérer que le Score de la version de tâche figée, en conservant le jeu public, le jeu privé et les intervalles de confiance pour vérification ; les trois scores liés ne doivent pas être comptés plusieurs fois. FACTS ne figure pas dans AA v4.3 .3 parmi les dix évaluations sous-jacentes.
Comment utiliser ces preuves
En observation : protocole et licence officiels confirmés, mais aucun nombre de questions terminées ni marqueur d'exhaustivité ; certaines plages de lignes sont nettement larges, et les modalités d'agrégation du score total avec les ensembles public et privé restent à confirmer. En attente des explications de l'évaluateur ; on ne supprime pas les lignes aberrantes pour forcer l'intégration, et cela ne consomme pas de budget de notation.
Limites de l'évaluation et attribution des données
Le juge et le commanditaire de l'évaluation viennent tous deux de Google ; à recouper avec les preuves d'autres organismes. L'export ne précise pas si une partie des résultats porte sur le même jeu de questions ; on ne peut pas prendre un résultat partiel pour une évaluation complète. La taille d'échantillon déduite des intervalles n'est pas un fait confirmé officiellement.
Licence des données :Apache 2.0 · Déclaré explicitement sur la page officielle du benchmark et du Score task ; la documentation Kaggle propose un téléchargement JSON du classement public sans connexion.
Résultats publiés par Google DeepMind / Kaggle ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.