Les modèles de fondation peuvent-ils annoter des données comme des humains ?
Hugging Face étend l'Open LLM Leaderboard avec des annotations humaines et des évaluations GPT-4 sur un jeu de test aveugle de 327 prompts。
Motif de la recommandation :L'étude compare les annotations humaines et GPT-4 sur un même jeu de prompts et quantifie le biais positionnel ainsi que les écarts de corrélation par catégorie de tâche.