BullshitBench v2
Peter Gostev / BullshitBench / Connaissance · Repérer les prémisses erronées dans une question et voir si le modèle continue d'inventer en suivant l'erreur.
Ce qu'il mesure, comment il le mesure
Retient le taux d'identification explicite sur toutes les tentatives, par défaut officiel, et conserve la note moyenne des réponses fournies ; le taux de refus est gardé pour audit. Ces deux indicateurs bruts n'entrent pas dans le vote global ou par catégorie actuel.
Comment utiliser ces preuves
Score brut à titre indicatif : collecte automatique après vérification de l'agrégation, du jeu de questions, de la configuration et de la date d'exécution sur une même version publique des données. Les modèles anonymes n'étant pas divulgués, impossible de confirmer qu'une interface glissante à version figée ne fait pas office de score représentatif ; n'entre pas dans le score global ou par catégorie pour l'instant.
Limites de l'évaluation et attribution des données
Toutes les questions sont à prémisse erronée et ne peuvent représenter l'étendue des connaissances générales ; le juge modèle et le traitement des refus influencent les résultats ; les alias glissants et les modèles anonymes doivent d'abord passer une vérification d'identité.
Licence des données :MIT · Copyright (c) 2026 Peter Gostev ;Les scores officiels sont publiés avec le dépôt, sans licence de données distincte.
Résultats publiés par Peter Gostev / BullshitBench ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.