Mercor APEX-Agents 1.1
Mercor / Travail professionnel · Des tâches longues de banque d'affaires, de conseil et de droit, pour voir si le modèle, en assistant, peut mener à bien un travail complet.
Ce qu'il mesure, comment il le mesure
1 figé.1 jeu de données et environnement Loop officiel, avec Pass@1 @1 et l'erreur correspondante, la configuration étant choisie selon un niveau de raisonnement fixé à l'avance. Le Mean Score est la moyenne d'achèvement des critères de notation, à ne pas confondre avec un taux de réussite des tâches.
Comment utiliser ces preuves
Après vérification via le protocole mono-modèle, participe au classement de référence dans la limite de la part de la famille de questions du domaine de compétence concerné ; les mesures d'une même famille de questions n'augmentent pas la part totale de la famille. La part effective figure dans l'enregistrement de calcul en cours.
Scores d'évaluation
Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.
| Rang sur le classement d'origine | Modèle au classement d'origine | Score brut | Configuration de référence |
|---|---|---|---|
| 1 | gemini-4-argonGoogle | 82.2% | High « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 2 | claude-sonnet-5-5Anthropic | 75.5% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 3 | claude-opus-5-5Anthropic | 73.5% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 4 | claude-fable-5.1Anthropic | 68.6% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 5 | gemini-3.7-flashGoogle | 67.8% | High « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 6 | claude-opus-5Anthropic | 65.8% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 7 | grok-4-6-xhighxAI | 65.3% | xHigh « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 8 | gpt-6-astra-maxOpenAI | 64.7% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 9 | gemini-3.8-flashGoogle | 64.3% | High « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 10 | claude-fable-5Anthropic | 63.6% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 11 | qwen-3-8-max-xhighAlibaba | 63.3% | xHigh « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 12 | gpt-6-1-solOpenAI | 60.0% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 14 | muse-spark-1-3Meta | 58.6% | xHigh « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 15 | gpt-5.6-terra-maxOpenAI | 58.2% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 16 | glm-5-3Z.ai | 56.6% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 17 | grok-4-5xAI | 56.2% | High « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 18 | deepseek-v4-flashDeepSeek | 55.3% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 19 | gpt-5.5-xhighOpenAI | 55.1% | xHigh « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 20 | grok-4.7xAI | 54.6% | xHigh « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 21 | claude-sonnet-5-maxAnthropic | 54.5% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 22 | gpt-6-solOpenAI | 54.3% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 23 | glm-5-3-flashZ.ai | 52.8% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 25 | responses/gpt-5.4OpenAI | 52.4% | xHigh « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 26 | gpt-5-6-sol-max-proOpenAI | 51.4% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 27 | kimi-k3Moonshot AI | 50.6% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 28 | claude-opus-4-7Anthropic | 49.2% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 29 | claude-opus-4-8Anthropic | 48.9% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 30 | qwen-3-8-27bAlibaba | 47.5% | xHigh « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 31 | deepseek-v4-pro-08-13DeepSeek | 47.3% | Max « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
| 32 | gemini-3.6-flashGoogle | 46.9% | High « inférence » · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent |
Limites de l'évaluation et attribution des données
Limité aux tâches de banque d'affaires, de conseil et de droit ; la page d'origine ne fournit pas de date d'évaluation par modèle, et la raison de quelques exécutions manquantes n'est pas divulguée. Ce score ne peut pas être interprété comme la fiabilité de tout travail de bureau.
Licence des données :résultats publics officiels ; la licence des données et du code ne vaut pas autorisation de rediffusion du classement
Résultats publiés par Mercor ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.