Hugging Face Blog·· 2026-09-02AI Score36
BenchMIRT : que mesurent réellement les benchmarks de LLM ?
BenchMIRT: What are LLM benchmarks actually measuring?
AI Introduction
Hugging Face présente BenchMIRT, une méthode qui applique l'Item Response Theory multidimensionnelle (MIRT) au niveau de chaque prompt pour auditer les benchmarks de LLM. Entraînée sur les résultats de 100 LLM, 16 benchmarks et plus de 34K questions, elle identifie sans supervision deux dimensions dominantes : sécurité et raisonnement général. L'analyse montre que les scores de BBQ et WMDP sont davantage liés au raisonnement général qu'à la sécurité, et que les questions de copyright de HarmBench se rapprochent aussi du raisonnement général, signe qu'un score unique peut mélanger plusieurs signaux.
Source :Hugging Face Blog · huggingface.co