Aller au contenu

Arena Vision Style-Controlled

LMArena · Des humains choisissent à l'aveugle des réponses accompagnées d'images, pour observer l'expérience réelle de compréhension visuelle.

Évaluation officielle
dans le Actu Créaflash surClassé
Budget de preuves12.5%
Date des données amont10/02 08:00
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

Lire uniquement le jeu de données officiel vision_style_control « overall » ; ne comprend ni génération ni édition d'images.

Comment utiliser ces preuves

Après vérification via le protocole mono-modèle, participe au classement de référence dans la limite de la part de la famille de questions du domaine de compétence concerné ; les mesures d'une même famille de questions n'augmentent pas la part totale de la famille. La part effective figure dans l'enregistrement de calcul en cours.

Scores d'évaluation

Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration de référence
1claude-fable-5-highAnthropic1,308.8High « inférence »
2qwen3.8-maxAlibaba1,301.2Configuration par défaut de la source
3claude-opus-4-6-highAnthropic1,299.4High « inférence »
5claude-opus-4-7-highAnthropic1,297.7High « inférence »
6gemini-3.7-flash-highGoogle1,296High « inférence »
8muse-sparkMeta1,293.6Configuration par défaut de la source
9muse-spark-1.2 (xHigh)Meta1,292.8xHigh « inférence »
10gpt-6.1-sol-maxOpenAI1,290.6Max « inférence »
11gemini-3.8-flash-highGoogle1,290.3High « inférence »
12muse-spark-1.3-maxMeta1,290.2Max « inférence »
13gemini-3-proGoogle1,289.3Configuration par défaut de la source
14claude-opus-5-highAnthropic1,289High « inférence »
15claude-fable-5.1-maxAnthropic1,287.7Max « inférence »
17claude-opus-4-8-highAnthropic1,286.4High « inférence »
18gpt-5.6-sol-xhighOpenAI1,284.7xHigh « inférence »
20gpt-6-astra-maxOpenAI1,284.3Max « inférence »
21gemini-3.5-flash-highGoogle1,284.1High « inférence »
22gpt-5.4-highOpenAI1,283.8High « inférence »
23muse-spark-1.1Meta1,281.1Configuration par défaut de la source
24gpt-5.5-highOpenAI1,281High « inférence »
25gemini-3.6-flash-highGoogle1,279.7High « inférence »
27gemini-3.1-pro-previewGoogle1,279.3Configuration par défaut de la source
28grok-4.5xAI1,279Configuration par défaut de la source
30glm-5.3-flashZ.ai1,278.4Configuration par défaut de la source
31gpt-5.2-chat-latest-20260210OpenAI1,278Configuration par défaut de la source
32gpt-5.5-instantOpenAI1,276Configuration par défaut de la source
33claude-sonnet-4-6Anthropic1,275.2Configuration par défaut de la source
34gemini-3-flashGoogle1,272.9Configuration par défaut de la source
35claude-sonnet-5.5-xhighAnthropic1,268.3xHigh « inférence »
36gpt-5.6-terra-xhighOpenAI1,268.2xHigh « inférence »
Limites de l'évaluation et attribution des données

Les préférences humaines dépendent du style, de la structure des utilisateurs et de la distribution des prompts. Les catégories générale et créative ont des votes qui se recoupent et partagent le même budget de préférences humaines ; elles ne sont pas considérées comme deux évaluateurs indépendants.

Licence des données :CC BY 4.0

Résultats publiés par LMArena ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.