OpenAI et Anthropic publient les résultats d'une évaluation de sécurité conjointe
OpenAI et Anthropic publient les résultats d'une évaluation de sécurité conjointe inédite。
Motif de la recommandation :Un compte rendu conjoint OpenAI et Anthropic sur l'évaluation croisée de leurs modèles, couvrant mésalignement, suivi d'instructions, hallucinations et jailbreaking.