Aller au contenu

GPQA Diamond

Epoch AI / Connaissance · Connaissances en physique, chimie et biologie de niveau master

Évaluation officielle
dans le Actu Créaflash surClassé
Budget de preuves6.3%
Date des données amont09/30 06:00
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

On ne retient que le mean des réexécutions propres à Epoch_score, Conserve le niveau de raisonnement et l'erreur standard. Les 198 questions de connaissances scientifiques demandent du raisonnement, mais ne représentent pas l'ensemble des connaissances du monde.

Comment utiliser ces preuves

Après vérification via le protocole mono-modèle, participe au classement de référence dans la limite de la part de la famille de questions du domaine de compétence concerné ; les mesures d'une même famille de questions n'augmentent pas la part totale de la famille. La part effective figure dans l'enregistrement de calcul en cours.

Scores d'évaluation

Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration de référence
1gpt-6-astra_maxOpenAI95.8%Max « inférence »
2claude-sonnet-5-5_maxAnthropic95.6%Max « inférence »
3gpt-6.1-sol_maxOpenAI95.4%Max « inférence »
3gemini-3.8-flash_highGoogle95.4%High « inférence »
5gemini-3.7-flash_highGoogle94.8%High « inférence »
6gpt-5.4-pro-2026-03-05_xhighOpenAI94.6%xHigh « inférence »
7gemini-3.1-pro-preview_highGoogle94.4%High « inférence »
8gpt-6-sol_maxOpenAI94.3%Max « inférence »
9gemini-3.6-flash_highGoogle94.1%High « inférence »
11gpt-5.5-pre-release_xhighOpenAI94.0%xHigh « inférence »Non pris en compte :La source indique explicitement une version préliminaire, elle ne représente pas un modèle de production utilisable.
13gpt-5.5-pro-pre-release_xhighOpenAI93.9%xHigh « inférence »Non pris en compte :La source indique explicitement une version préliminaire, elle ne représente pas un modèle de production utilisable.
14claude-opus-5_maxAnthropic93.9%Max « inférence »
15gpt-5.6-sol_maxOpenAI93.5%Max « inférence »
16grok-4.5_highxAI93.4%High « inférence »
17gpt-5.6-terra_maxOpenAI93.3%Max « inférence »
18gpt-5.4-2026-03-05_xhighOpenAI93.3%xHigh « inférence »
19grok-4.6_xhighxAI93.2%xHigh « inférence »
20kimi-k3_maxMoonshot AI93.1%Max « inférence »
22gemini-3.5-flash_highGoogle92.8%High « inférence »
23grok-4.7_xhighxAI92.7%xHigh « inférence »
24qwen3.8-max_xhighAlibaba92.7%xHigh « inférence »
25gemini-3-pro-previewGoogle92.6%Configuration par défaut de la source
26qwen3.8-max-0902_xhighAlibaba92.3%xHigh « inférence »
28glm-5.2_maxZ.ai91.9%Max « inférence »
29deepseek-v4-pro-0813_maxDeepSeek91.7%Max « inférence »
30gpt-5.6-luna_maxOpenAI91.6%Max « inférence »
31gpt-5.2-2025-12-11_xhighOpenAI91.4%xHigh « inférence »
32deepseek-v4-flash-0731_maxDeepSeek91.0%Max « inférence »
32claude-opus-4-8_maxAnthropic91.0%Max « inférence »
34glm-5.3_maxZ.ai90.9%Max « inférence »
Limites de l'évaluation et attribution des données

Comptabilisé dans le score officiel ; une même famille de questions partage un budget fixe.

Licence des données :CC BY 4.0 · Epoch AI données d'évaluation propres

Résultats publiés par Epoch AI ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.