Simon Willison·· 4 jAI Score62
Anthropic Frontier Red Team évalue les capacités cyber de GLM-5.3 et Claude Mythos Preview
Quoting Anthropic Frontier Red Team
AI Introduction
L'équipe Frontier Red Team d'Anthropic indique avoir évalué plusieurs modèles sur 100 tâches tirées au hasard d'un benchmark interne d'exploitation binaire. GLM-5.3 parvient à un détournement complet du flux de contrôle dans 4 % des essais, contre 6 % pour Claude Mythos Preview. Les modèles antérieurs, comme Claude Opus 4.6 et GLM-5.2, n'y réussissent dans aucun essai, ce qui marque selon l'équipe un seuil significatif franchi.
Source :Simon Willison · simonwillison.net