Aller au contenu
Google DeepMind·· 2025-12-09sélectionAI Score62

Google DeepMind et Kaggle lancent la suite de benchmarks FACTS pour évaluer la factualité des LLM

FACTS Benchmark Suite: Systematically evaluating the factuality of large language models

AI Introduction

Google DeepMind et Kaggle lancent la suite de benchmarks FACTS, qui étend le FACTS Grounding Benchmark avec trois nouveaux benchmarks.

Raison de la recommandation

Le lecteur peut situer les quatre axes d'évaluation de la factualité et les écarts de performance entre les principaux modèles.

Source :Google DeepMind · deepmind.google