EBR-bench
Epoch AI / Travail professionnel · Apprendre de nouvelles règles et mobiliser la mémoire dans des tâches longues
Ce qu'il mesure, comment il le mesure
L'agrégat public mélange des configurations de compression de mémoire ; à titre indicatif seulement tant que des scores comparables à configuration fixe ne sont pas disponibles.
Comment utiliser ces preuves
Uniquement à titre indicatif, sans entrée dans les scores globaux ou de catégorie.
Scores d'évaluation
Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.
| Rang sur le classement d'origine | Modèle au classement d'origine | Score brut | Configuration de référence |
|---|---|---|---|
| 1 | gpt-6-astra_maxOpenAI | 76.2% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 2 | claude-opus-5-5_maxAnthropic | 71.4% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 3 | claude-fable-5-1_maxAnthropic | 57.1% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 4 | gpt-6.1-sol_maxOpenAI | 54.3% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 5 | gpt-6-sol_maxOpenAI | 53.3% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 6 | claude-opus-5_maxAnthropic | 45.7% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 7 | gpt-5.6-sol_maxOpenAI | 44.8% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 8 | claude-fable-5_maxAnthropic | 39.5% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 9 | gpt-5.5_xhighOpenAI | 34.3% | xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 10 | grok-4.6_xhighxAI | 30.5% | xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 11 | claude-opus-4-8_maxAnthropic | 28.6% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 12 | gpt-5.4-2026-03-05_xhighOpenAI | 25.4% | xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 13 | gpt-5.2-2025-12-11_xhighOpenAI | 23.0% | xHigh « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 14 | claude-opus-4-7_maxAnthropic | 19.0% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 15 | claude-opus-4-5-20251101_128KAnthropic | 14.3% | Configuration par défaut de la source · 128kNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 15 | gemini-3.1-pro-previewGoogle | 14.3% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 17 | gpt-5-2025-08-07_highOpenAI | 12.7% | High « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 17 | claude-opus-4-6_maxAnthropic | 12.7% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 19 | qwen3.7-maxAlibaba | 9.5% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 19 | glm-5.2_maxZ.ai | 9.5% | Max « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 21 | claude-opus-4-1-20250805Anthropic | 7.9% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 22 | gemini-3.5-flash_highGoogle | 4.8% | High « inférence »Non pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 23 | claude-sonnet-4-5-20250929Anthropic | 2.4% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
| 23 | kimi-k2.6Moonshot AI | 2.4% | Configuration par défaut de la sourceNon pris en compte :Le protocole d'évaluation mono-modèle de cette source n'a pas encore été vérifié. |
Limites de l'évaluation et attribution des données
Uniquement à titre indicatif, sans entrée dans les scores globaux ou de catégorie.
Licence des données :CC BY 4.0 · Epoch AI données d'évaluation propres
Résultats publiés par Epoch AI ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.