Hugging Face Blog·· 2023-12-01AI Score52
Open LLM Leaderboard retire le benchmark DROP après avoir identifié des erreurs de notation
Open LLM Leaderboard: DROP deep dive
AI Introduction
Hugging Face a retiré le benchmark DROP de l'Open LLM Leaderboard après avoir constaté que la majorité des modèles obtenaient un f1-score inférieur à 10 sur 100. L'enquête a révélé que la normalisation ignorait les réponses numériques suivies d'un espace autre qu'un espace simple, et que l'utilisation du point comme token d'arrêt interrompait les réponses à virgule flottante et pénalisait les modèles générant de longues réponses. Une réexécution complète coûtant 8 années de temps GPU, l'équipe a décidé de retirer DROP jusqu'à ce qu'une nouvelle version corrige le scoring et la normalisation.
Source :Hugging Face Blog · huggingface.co