Aller au contenu

Terminal-Bench 4 · référence système

Harbor / Terminal-Bench / programmation · Conserver les résultats bruts des modèles associés à différents Agents sur les tâches en terminal, pour recoupement.

Évaluation officielle
dans le Actu Créaflash surÀ titre indicatif
Budget de preuvesHors classement
Date des données amont09/03 10:43
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

Version figée Terminal-Bench 4.0, Conserver séparément le modèle, la version de l'Agent, le niveau de raisonnement et le nombre d'exécutions ; ne pas interpréter différents systèmes d'outillage comme des conditions de modèle unifiées.

Comment utiliser ces preuves

Référence de résultats bruts : collecte automatique après verrouillage de la liste officielle des soumissions et de la version des données, en conservant entrée par entrée les différentes configurations système, sans choisir de score représentatif par modèle. Uniquement pour recoupement, sans entrée dans le classement global ou de programmation.

Scores d'évaluation

Voici les scores système de modèles associés à différents agents ; les conditions d'exécution diffèrent, à titre indicatif. Chaque entrée affiche au maximum 30 configurations, les modèles testés de façon anonyme ne sont pas affichés.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration d'exécution
1claude-fable-5-1Anthropic57.9%Claude Code 2.1.257 · max « inférence »
2claude-opus-5Anthropic51.8%Claude Code 2.1.231 · max « inférence »
3claude-fable-5Anthropic44.5%Claude Code 2.1.231 · max « inférence »
4glm-5.3Z.ai41.8%Claude Code 2.1.207 · max « inférence »
5gpt-5.6-solOpenAI37.3%Codex 0.149.1 · max « inférence »
6claude-opus-4-8Anthropic23.6%Claude Code 2.1.231 · max « inférence »
7gpt-5.6-terraOpenAI21.5%Codex 0.149.1 · max « inférence »
8grok-4.6xAI20.3%Grok Build 1.0.5 · niveau de raisonnement non indiqué par la source
9gemini-3.8-flashGoogle19.1%mini-SWE-agent 2.4.6 · high « inférence »
10gpt-5.6-lunaOpenAI17.3%Codex 0.149.1 · max « inférence »
11grok-4.5xAI12.4%Grok Build 1.0.5 · niveau de raisonnement non indiqué par la source
11claude-sonnet-5Anthropic12.4%Claude Code 2.1.231 · max « inférence »
13gemini-3.7-flashGoogle11.2%mini-SWE-agent 2.4.6 · high « inférence »
Limites de l'évaluation et attribution des données

Les différents modèles utilisent des outils différents comme Claude Code, Codex, GrokBuild ou mini-SWE ; AA v4.3 inclut déjà Terminal-Bench v4 ; à ne pas compter une nouvelle fois dans le poids de vote global.

Licence des données :Apache 2.0 · soumissions de scores dans le dépôt officiel harbor-framework/terminal-bench ; conserver l'attribution, la licence et la mention des modifications.

Résultats publiés par Harbor / Terminal-Bench ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.