Vending-Bench 2
Andon Labs / Travail professionnel · Gère une boutique simulée pendant un an : achats, négociations, stocks et tarification.
Ce qu'il mesure, comment il le mesure
Comparer le solde final d'une même tâche mono-agent V2, en conservant la variance entre les exécutions ; l'Arena multi-agents, les différents outils et les configurations d'inférence sont traités séparément. Le résultat d'exploitation de la tâche est une note d'évaluation ; le prix de l'API n'entre pas dans le score de capacité.
Comment utiliser ces preuves
Sous observation : l'intérêt d'ajouter de la gestion à long terme et du e-commerce est clair ; le protocole de scores bruts stable, la configuration d'exécution et la licence de rediffusion restent à compléter. Les profits peuvent aussi venir d'un usage détourné du simulateur et ne sont pas directement assimilables à une gestion fiable.
Limites de l'évaluation et attribution des données
Sous observation : l'intérêt d'ajouter de la gestion à long terme et du e-commerce est clair ; le protocole de scores bruts stable, la configuration d'exécution et la licence de rediffusion restent à compléter. Les profits peuvent aussi venir d'un usage détourné du simulateur et ne sont pas directement assimilables à une gestion fiable.
Licence des données :Limites d'usage des données du classement à confirmer
Résultats publiés par Andon Labs ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.