Aller au contenu
Simon Willison·· 4 jAI Score62

Anthropic Frontier Red Team évalue les capacités cyber de GLM-5.3 et Claude Mythos Preview

Quoting Anthropic Frontier Red Team

AI Introduction

L'équipe Frontier Red Team d'Anthropic indique avoir évalué plusieurs modèles sur 100 tâches tirées au hasard d'un benchmark interne d'exploitation binaire. GLM-5.3 parvient à un détournement complet du flux de contrôle dans 4 % des essais, contre 6 % pour Claude Mythos Preview. Les modèles antérieurs, comme Claude Opus 4.6 et GLM-5.2, n'y réussissent dans aucun essai, ce qui marque selon l'équipe un seuil significatif franchi.

Source :Simon Willison · simonwillison.net