Aller au contenu
OpenAI News·· 2025-09-17sélectionAI Score62

OpenAI et Apollo Research développent des évaluations pour détecter et réduire la dissimulation dans les modèles d'IA

Detecting and reducing scheming in AI models

AI Introduction

Apollo Research et OpenAI ont développé des évaluations pour la mauvaise alignement cachée.

Raison de la recommandation

OpenAI et Apollo Research présentent des évaluations du comportement de dissimulation et une méthode précoce pour le réduire, ce qui éclaire les risques d'alignement des modèles de pointe.

Source :OpenAI News · openai.com