SimpleBench
SimpleBench / « inférence » · Des questions de bon sens quotidien et de logique pour vérifier si le modèle identifie les contraintes réelles d'un problème.
Ce qu'il mesure, comment il le mesure
Distingue les questions à choix multiple des réponses ouvertes ; fixe l'AVG@5, la température et le protocole d'invite ; la date d'ajout au classement ne vaut pas date d'évaluation question par question.
Comment utiliser ces preuves
Observation candidate : la couverture des nouveautés est réactive ; en attente de précisions sur les limites de réutilisation des scores officiels et sur une version de données figée ; la licence du code ne s'applique pas ; ni collecte ni notation automatiques pour l'instant.
Limites de l'évaluation et attribution des données
Les questions de bon sens quotidien ont une valeur complémentaire, mais la représentativité des questions et les conditions QCM/réponses ouvertes influent sur l'interprétation.
Licence des données :Questions d'exemple et dépôt de code d'évaluation sous MIT ; les limites de réaffichage des derniers scripts de scores publiés séparément par le site officiel ne sont pas encore confirmées.
Résultats publiés par SimpleBench ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.