Claude Opus 5
Anthropic · 2026-07-24 sortie · 10/03 20:40 mise à jour
Chacun ses forces, plus de clarté.
Chaque catégorie est notée séparément ; plus la note est élevée, meilleure est la performance dans cette catégorie. Pour le détail des capacités, voir les scores bruts et les configurations.
Les notes et les rangs de référence ne se comparent qu'au sein d'une même catégorie et d'une même série. Les tests manquants ne sont pas compensés ; le taux de couverture n'indique pas le niveau de capacité.
Chaque résultat a sa source.
Ci-dessous, les résultats publics agrégés de ce modèle. Dépliez pour voir la configuration d'exécution et le mode d'adoption.
Évaluations globales et expérience4 éléments
programmation2 éléments
« inférence »5 éléments
Connaissance2 éléments
Travail professionnel1 éléments
Compréhension visuelle1 éléments
Testé, mais exclu selon les règles
Ces résultats publics ne remplissent pas les conditions de comparabilité de ce classement ; voici pourquoi. Un outillage fixe et un même modèle du début à la fin sont acceptés ; les systèmes à repli multi-modèles, à modèles mixtes ou à agent hétérogène dédié ne sont pas intégrés au classement des modèles. Les éléments non précisés dans les sources restent inconnus.
- Vals Finance Agent :La source utilise explicitement un mélange de modèles ou un repli, ces résultats ne peuvent pas être des scores mono-modèle.
Certaines inconnues subsistent
L'ordre de référence ne résume que les preuves publiques disponibles ; les mesures manquantes ne sont pas compensées. Des configurations d'exécution différentes, des erreurs inconnues ou de nouvelles évaluations peuvent modifier cet ordre : des rangs voisins n'impliquent pas un écart de capacité démontré.
Dimensions de capacité manquantes :Chinois et multilinguisme.
7 résultats retenus ne publient pas d'erreur standard exploitable ; l'inconnu n'est pas traité comme une erreur nulle.
En savoir plus sur la méthode de calcul →