Aller au contenu

Mercor APEX-Agents 1.1

Mercor / Travail professionnel · Des tâches longues de banque d'affaires, de conseil et de droit, pour voir si le modèle, en assistant, peut mener à bien un travail complet.

Évaluation officielle
dans le Actu Créaflash surClassé
Budget de preuves6.3%
Date des données amont09/08 08:00
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

1 figé.1 jeu de données et environnement Loop officiel, avec Pass@1 @1 et l'erreur correspondante, la configuration étant choisie selon un niveau de raisonnement fixé à l'avance. Le Mean Score est la moyenne d'achèvement des critères de notation, à ne pas confondre avec un taux de réussite des tâches.

Comment utiliser ces preuves

Après vérification via le protocole mono-modèle, participe au classement de référence dans la limite de la part de la famille de questions du domaine de compétence concerné ; les mesures d'une même famille de questions n'augmentent pas la part totale de la famille. La part effective figure dans l'enregistrement de calcul en cours.

Scores d'évaluation

Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration de référence
1gemini-4-argonGoogle82.2%High « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
2claude-sonnet-5-5Anthropic75.5%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
3claude-opus-5-5Anthropic73.5%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
4claude-fable-5.1Anthropic68.6%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
5gemini-3.7-flashGoogle67.8%High « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
6claude-opus-5Anthropic65.8%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
7grok-4-6-xhighxAI65.3%xHigh « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
8gpt-6-astra-maxOpenAI64.7%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
9gemini-3.8-flashGoogle64.3%High « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
10claude-fable-5Anthropic63.6%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
11qwen-3-8-max-xhighAlibaba63.3%xHigh « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
12gpt-6-1-solOpenAI60.0%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
14muse-spark-1-3Meta58.6%xHigh « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
15gpt-5.6-terra-maxOpenAI58.2%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
16glm-5-3Z.ai56.6%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
17grok-4-5xAI56.2%High « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
18deepseek-v4-flashDeepSeek55.3%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
19gpt-5.5-xhighOpenAI55.1%xHigh « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
20grok-4.7xAI54.6%xHigh « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
21claude-sonnet-5-maxAnthropic54.5%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
22gpt-6-solOpenAI54.3%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
23glm-5-3-flashZ.ai52.8%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
25responses/gpt-5.4OpenAI52.4%xHigh « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
26gpt-5-6-sol-max-proOpenAI51.4%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
27kimi-k3Moonshot AI50.6%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
28claude-opus-4-7Anthropic49.2%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
29claude-opus-4-8Anthropic48.9%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
30qwen-3-8-27bAlibaba47.5%xHigh « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
31deepseek-v4-pro-08-13DeepSeek47.3%Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
32gemini-3.6-flashGoogle46.9%High « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
Limites de l'évaluation et attribution des données

Limité aux tâches de banque d'affaires, de conseil et de droit ; la page d'origine ne fournit pas de date d'évaluation par modèle, et la raison de quelques exécutions manquantes n'est pas divulguée. Ce score ne peut pas être interprété comme la fiabilité de tout travail de bureau.

Licence des données :résultats publics officiels ; la licence des données et du code ne vaut pas autorisation de rediffusion du classement

Résultats publiés par Mercor ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.