Aller au contenu

Vals Finance Agent

Vals AI / Travail professionnel · Des tâches de bureau du quotidien d'un analyste financier, pour juger le travail sur les notes d'analyse et la modélisation.

Évaluation officielle
dans le Actu Créaflash surClassé
Budget de preuves6.3%
Date des données amont10/01 08:00
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

On ne retient que le taux de réussite Overall officiel de Finance Agent v2.

Comment utiliser ces preuves

Après vérification via le protocole mono-modèle, participe au classement de référence dans la limite de la part de la famille de questions du domaine de compétence concerné ; les mesures d'une même famille de questions n'augmentent pas la part totale de la famille. La part effective figure dans l'enregistrement de calcul en cours.

Scores d'évaluation

Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration de référence
1google/gemini-4-argonGoogle65.4%High « inférence »
2google/gemini-3.8-flashGoogle61.4%High « inférence »
3meta/muse_spark_1_2Meta60.6%xHigh « inférence »
4meta/muse_spark_1_3_maxMeta60.0%Max « inférence »
5google/gemini-3.7-flashGoogle59.0%High « inférence »
7anthropic/claude-fable-5-1Anthropic58.9%Max « inférence »
8anthropic/claude-opus-5Anthropic58.6%Max « inférence »Non pris en compte :La source utilise explicitement un mélange de modèles ou un repli, ces résultats ne peuvent pas être des scores mono-modèle.
9anthropic/claude-opus-5-5Anthropic58.6%Max « inférence »
10anthropic/claude-sonnet-5-5Anthropic58.1%Max « inférence »
11google/gemini-3.5-flashGoogle57.9%High « inférence »
12zai/glm-5.3-flashZ.ai57.9%Max « inférence »
13xiaomi/mimo-v2.6-proXiaomi57.3%Configuration par défaut de la source
14meta/muse_spark_1_1Meta57.2%xHigh « inférence »
15anthropic/claude-fable-5Anthropic56.3%Max « inférence »
16google/gemini-3.6-flashGoogle56.3%High « inférence »
17xiaomi/mimo-v2.6-flashXiaomi56.3%Configuration par défaut de la source
18zai/glm-5.3Z.ai55.8%Max « inférence »
19tencent/hy4-previewTencent55.1%Configuration par défaut de la source
20openai/gpt-5.6-lunaOpenAI55.0%Max « inférence »
21ant/ling-3.0-flash-af-rc3Ant54.9%Configuration par défaut de la source
22openai/gpt-5.6-terraOpenAI54.4%Max « inférence »
23anthropic/claude-opus-4-8Anthropic53.9%Max « inférence »
24anthropic/claude-sonnet-5Anthropic53.9%Max « inférence »
25openai/gpt-5.6-solOpenAI53.8%Max « inférence »
26grok/grok-4.6xAI53.7%High « inférence »
27openai/gpt-6-astraOpenAI53.5%Max « inférence »
28deepseek/deepseek-v4.1-flashDeepSeek53.5%High « inférence »
29kimi/kimi-k3Moonshot AI53.1%Max « inférence »
30grok/grok-4.7xAI52.3%xHigh « inférence »
31openai/gpt-6.1-solOpenAI52.0%Max « inférence »
Limites de l'évaluation et attribution des données

Les questions privées ne peuvent pas être recalculées une par une ; comme APEX, il s'agit de tâches de bureau, donc un même budget doit être partagé. La communication officielle exclut certaines configurations en raison de replis entre modèles ; l'appel de recherche propre au modèle et le modèle juge sont vérifiés séparément.

Licence des données :résultats publics officiels ; toute réutilisation publique conserve l'attribution officielle ; l'autorisation de rediffusion complète reste régie par les conditions de Vals

Résultats publiés par Vals AI ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.