Aller au contenu
Hugging Face Blog·· 2026-05-06AI Score38

Hugging Face ajoute des datasets privés à l'Open ASR Leaderboard pour contrer le benchmaxxing

Adding Benchmaxxer Repellant to the Open ASR Leaderboard

AI Introduction

Hugging Face a intégré des datasets audio privés d'Appen Inc. et DataoceanAI à l'Open ASR Leaderboard afin de limiter les risques de benchmaxxing et de contamination des jeux de test. Ces données couvrent de l'anglais scripté et conversationnel sur plusieurs accents (australien, canadien, indien, américain, britannique), avec des durées allant de 1,02 h à 8,82 h selon les splits. Le WER moyen par défaut reste calculé uniquement sur les datasets publics, un toggle permettant d'inclure les datasets privés ; les scores par split ne sont volontairement pas publiés pour éviter les optimisations ciblées.

Source :Hugging Face Blog · huggingface.co