Google DeepMind·· 2025-12-09sélectionAI Score62
Google DeepMind et Kaggle lancent la suite de benchmarks FACTS pour évaluer la factualité des LLM
FACTS Benchmark Suite: Systematically evaluating the factuality of large language models
AI Introduction
Google DeepMind et Kaggle lancent la suite de benchmarks FACTS, qui étend le FACTS Grounding Benchmark avec trois nouveaux benchmarks.
Raison de la recommandation
Le lecteur peut situer les quatre axes d'évaluation de la factualité et les écarts de performance entre les principaux modèles.
Source :Google DeepMind · deepmind.google