MCP Atlas
Scale AI / Travail professionnel · Réalise des tâches inter-logiciels en recherchant des informations, en manipulant des documents et des bases de données via de vrais services MCP.
Ce qu'il mesure, comment il le mesure
Fige le protocole d'exécution ajusté en avril 2026 et un budget de 100 appels d'outils ; les 1,000 000 questions du jeu complet sont séparées des 500 questions publiques. Seul le taux de réussite des tâches est retenu ; le taux de couverture des conditions de réponse n'est pas compté deux fois ; juges, tentatives et versions d'outils doivent être verrouillés avec le lot de scores.
Comment utiliser ces preuves
En observation : peut fournir des preuves d'exécution d'outils entre logiciels bureautiques ; export stable des scores, lot d'évaluation réel et limites de réaffichage à confirmer ; pour l'instant, seule la source est référencée, sans collecte ni notation automatiques.
Limites de l'évaluation et attribution des données
L'ancienne description de méthode sur le site et les scores en temps réel peuvent être désynchronisés ; le code du jeu de questions public n'est pas un export des scores en temps réel. Comme les autres classements de Scale, il relève du même organisme et n'augmente pas le nombre d'organismes indépendants.
Licence des données :Le code de l'environnement officiel est sous MIT ; cette licence ne couvre pas automatiquement les scores du site en temps réel, et les limites de réaffichage des données de classement restent à confirmer.
Résultats publiés par Scale AI ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.