Aller au contenu

Long-Horizon Terminal-Bench

Tencent HY / Lehigh soit / programmation · Utiliser le terminal de façon continue sur de longues durées, pour accomplir des tâches d'ingénierie et d'outillage complexes.

Évaluation officielle
dans le Actu Créaflash surEn observation
Budget de preuvesHors classement
Date des données amontÀ confirmer
Dernière synchronisation réussieCollecte non commencée

Ce qu'il mesure, comment il le mesure

90 minutes, 2 heures et 3 heures de budget comparées séparément ; les protocoles d'évaluation avant et après correction ne peuvent pas être mélangés, et le meilleur résultat de différents Agents ne peut pas être pris pour le score d'un modèle unifié.

Comment utiliser ces preuves

Observation candidate : en attente d'un nouveau lot indiquant explicitement le protocole de correction ; les anciens scores existants ne sont pas collectés automatiquement vers le classement public et ne sont pas notés ; on ne peut pas en conclure que chaque ancien résultat a exploité une faille.

Limites de l'évaluation et attribution des données

Une fuite d'informations d'évaluation a été divulguée officiellement ; il est actuellement impossible de prouver que les résultats existants relèvent du même protocole après isolation de l'évaluation. Le chevauchement des sources de certaines tâches avec d'autres évaluations spécialisées reste à vérifier.

Licence des données :Apache 2.0 · Jeu de données de résultats officiel IntelligenceLab/LHTB-leaderboard ; conserver l'attribution et la mention des modifications.

Résultats publiés par Tencent HY / Lehigh soit ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.