Terminal-Bench 4 · référence système
Harbor / Terminal-Bench / programmation · Conserver les résultats bruts des modèles associés à différents Agents sur les tâches en terminal, pour recoupement.
Ce qu'il mesure, comment il le mesure
Version figée Terminal-Bench 4.0, Conserver séparément le modèle, la version de l'Agent, le niveau de raisonnement et le nombre d'exécutions ; ne pas interpréter différents systèmes d'outillage comme des conditions de modèle unifiées.
Comment utiliser ces preuves
Référence de résultats bruts : collecte automatique après verrouillage de la liste officielle des soumissions et de la version des données, en conservant entrée par entrée les différentes configurations système, sans choisir de score représentatif par modèle. Uniquement pour recoupement, sans entrée dans le classement global ou de programmation.
Scores d'évaluation
Voici les scores système de modèles associés à différents agents ; les conditions d'exécution diffèrent, à titre indicatif. Chaque entrée affiche au maximum 30 configurations, les modèles testés de façon anonyme ne sont pas affichés.
| Rang sur le classement d'origine | Modèle au classement d'origine | Score brut | Configuration d'exécution |
|---|---|---|---|
| 1 | claude-fable-5-1Anthropic | 57.9% | Claude Code 2.1.257 · max « inférence » |
| 2 | claude-opus-5Anthropic | 51.8% | Claude Code 2.1.231 · max « inférence » |
| 3 | claude-fable-5Anthropic | 44.5% | Claude Code 2.1.231 · max « inférence » |
| 4 | glm-5.3Z.ai | 41.8% | Claude Code 2.1.207 · max « inférence » |
| 5 | gpt-5.6-solOpenAI | 37.3% | Codex 0.149.1 · max « inférence » |
| 6 | claude-opus-4-8Anthropic | 23.6% | Claude Code 2.1.231 · max « inférence » |
| 7 | gpt-5.6-terraOpenAI | 21.5% | Codex 0.149.1 · max « inférence » |
| 8 | grok-4.6xAI | 20.3% | Grok Build 1.0.5 · niveau de raisonnement non indiqué par la source |
| 9 | gemini-3.8-flashGoogle | 19.1% | mini-SWE-agent 2.4.6 · high « inférence » |
| 10 | gpt-5.6-lunaOpenAI | 17.3% | Codex 0.149.1 · max « inférence » |
| 11 | grok-4.5xAI | 12.4% | Grok Build 1.0.5 · niveau de raisonnement non indiqué par la source |
| 11 | claude-sonnet-5Anthropic | 12.4% | Claude Code 2.1.231 · max « inférence » |
| 13 | gemini-3.7-flashGoogle | 11.2% | mini-SWE-agent 2.4.6 · high « inférence » |
Limites de l'évaluation et attribution des données
Les différents modèles utilisent des outils différents comme Claude Code, Codex, GrokBuild ou mini-SWE ; AA v4.3 inclut déjà Terminal-Bench v4 ; à ne pas compter une nouvelle fois dans le poids de vote global.
Licence des données :Apache 2.0 · soumissions de scores dans le dépôt officiel harbor-framework/terminal-bench ; conserver l'attribution, la licence et la mention des modifications.
Résultats publiés par Harbor / Terminal-Bench ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.