TruthfulQA : mesurer comment les modèles imitent les fausses croyances humaines
TruthfulQA est un benchmark proposé par OpenAI pour mesurer dans quelle mesure les modèles de langage reproduisent les fausses croyances humaines. Le contenu source ne fournit que le titre.