OpenAI News·· 2025-09-17sélectionAI Score62
OpenAI et Apollo Research développent des évaluations pour détecter et réduire la dissimulation dans les modèles d'IA
Detecting and reducing scheming in AI models
AI Introduction
Apollo Research et OpenAI ont développé des évaluations pour la mauvaise alignement cachée.
Raison de la recommandation
OpenAI et Apollo Research présentent des évaluations du comportement de dissimulation et une méthode précoce pour le réduire, ce qui éclaire les risques d'alignement des modèles de pointe.
Source :OpenAI News · openai.com