Calcul du classement
Comprendre comment le score Actu Créaflash est calculé, ainsi que les résultats publics derrière chaque score.
D'abord le score, ensuite les points forts.
Le classement général et les quatre classements thématiques affichent au maximum 30 modèles.Actu Créaflash Le score facilite une comparaison rapide ; les sous-scores montrent les points forts de chacun et la couverture des preuves indique l'étendue des évaluations disponibles.
Le score est un indice de comparaison globale calculé à partir d'évaluations publiques ; ce n'est pas un taux de bonnes réponses et il ne reflète pas la capacité absolue sur toutes les tâches. Pour un usage précis, consultez les résultats bruts des sous-scores et la configuration d'exécution.
- 01
Vérifier d'abord le modèle et la configuration d'exécution
Unifier le nom du modèle, la version et la configuration d'inférence, puis choisir l'exécution représentative selon des règles fixées à l'avance, sans retenir le meilleur score. Une exécution avec outils fixes et un même modèle du début à la fin est acceptée ; les systèmes à repli multi-modèles, à modèles mélangés ou à agents hétérogènes propriétaires ne sont pas classés ensemble. Si la configuration n'est pas publiée, l'inconnu est conservé et l'on n'en conclut pas qu'il y a mélange de modèles.
- 02
Répartir par capacité, sans pondérer les preuves redondantes
Le classement général répartit à poids égal entre huit dimensions de capacité, chacune comptant pour 12.5%. Au sein d'une dimension, la pondération est ensuite répartie entre les familles de questions ; les résultats répétés d'une même banque de questions, les extraits de classement et les indicateurs composites déjà pris en compte ne sont pas pondérés une seconde fois. Toute nouvelle évaluation est d'abord vérifiée quant aux chevauchements de questions et de protocoles.
- 03
Calibrer les écarts réels avec une référence de même protocole
Ne comparer que les résultats que les deux modèles possèdent sous un même protocole d'évaluation, et calibrer les écarts continus à l'aide de l'écart interquartile d'un groupe de référence fixé à l'avance, afin de ne pas traiter un petit écart et un grand écart comme une même voix. Les mesures manquantes ne sont pas compensées, et une erreur standard inconnue n'est pas ramenée à zéro.
- 04
Convertir en score pour faciliter la comparaison
Agréger les écarts de résultats relatifs des évaluations communes et rechercher un ordre de référence présentant le moins de conflits. Tout en conservant cet ordre, ajuster les écarts de résultats communs sur une échelle de 0–100 de Actu Créaflash score ; les résultats bruts de chaque évaluation restent disponibles pour vérification.
Huit dimensions de capacité, à parts égales.
Codage, mathématiques et raisonnement, connaissances et faits, compréhension du langage et instructions, rédaction et expression, compréhension visuelle, tâches professionnelles, chinois et multilinguisme représentent chacun 12.5%. Il s'agit d'un choix public d'équilibre, et non du poids naturel des capacités générales. Chaque dimension reçoit d'abord une part de familles de questions, puis les évaluations internes à chaque famille sont traitées ; une question répétée n'augmente pas le poids total. Lorsque des sous-scores sont déjà utilisés, les indicateurs composites qui les incluent ne sont pas comptés une seconde fois. Une part manquante n'est pas reportée sur d'autres preuves.
- programmation12.5%Participent cette passe :DeepSWE v1.1 · LiveBench · Programmation générale
- Mathématiques et raisonnement12.5%Participent cette passe :LiveBench · Raisonnement et mathématiques · FrontierMath v2 · Tiers 1–3 · FrontierMath v2 · Tier 4 · Chess Puzzles · Mystery Game Puzzles
- Connaissances et faits12.5%Participent cette passe :SimpleQA Verified · GPQA Diamond
- Compréhension du langage et instructions12.5%Participent cette passe :LiveBench · Langage et instructions
- Rédaction et expression12.5%Participent cette passe :Arena Création en aveugle · Creative Writing v3 · Longform Writing
- Compréhension visuelle12.5%Participent cette passe :Arena Vision
- Tâches professionnelles sectorielles12.5%Participent cette passe :APEX-Agents 1.1 · Vals Finance Agent
- Chinois et multilinguisme12.5%Aucune preuve comptabilisable pour cette passe
Les quatre classements — codage, raisonnement, connaissances et travail professionnel — conservent une entrée distincte et ne comparent que les résultats publics de la capacité correspondante ; les scores par catégorie et les positions de référence ne se comparent pas d'une catégorie à l'autre. Des évaluations publiques issues du même organisme ne comptent pas comme plusieurs organismes indépendants. Des évaluations supplémentaires n'ont de valeur que si elles apportent des preuves valides différentes ; le nombre en lui-même n'augmente pas la part totale d'une dimension de capacité.
Vous voulez peut-être aussi savoir
Actu Créaflash score : comment le lire ?+
Pourquoi des rangs différents peuvent-ils avoir le même score ?+
Le rang de référence indique-t-il qui est forcément plus fort ?+
Qu'est-ce que le pourcentage de couverture des preuves ?+
L'écart de résultats relatifs des évaluations communes est-il un taux de victoire ?+
Pourquoi ne pas simplement retenir le meilleur résultat de chaque modèle ?+
Peut-on éliminer totalement les doublons, la contamination et les erreurs des évaluations ?+
Quand un nouveau modèle apparaît-il ?+
Que se passe-t-il si un classement est temporairement inaccessible ?+
Le prix ou la vitesse influencent-ils l'ordre de référence ?+
Voir les détails du calcul et la version actuelle+
Version de méthode :2026.10-observed-evidence-v17. L'identité du modèle, la configuration représentative, le rattachement aux familles de questions, les pondérations des dimensions, le groupe de référence et les entrées de calcul sont tous versionnés. L'ordre de référence utilise un tri Kemeny incomplet pondéré, qui minimise les conflits avec les écarts de résultats des évaluations communes ; seuls sont publiés les résultats dont la résolution est optimale et qui remplissent les conditions d'éligibilité et de connexité. Il peut exister plusieurs ordres tout aussi optimaux ; l'ordre d'affichage fixe ne signifie pas que tous les modèles ont étéprécisément distingués, et une résolution mathématique optimale ne prouve pas non plus l'ordre réel des capacités.
Pour chaque évaluation, le protocole et le sens sont d'abord confirmés, puis les écarts de score continus sont calibrés à l'aide de l'écart interquartile du groupe de référence fixe sous le même protocole (l'étendue de la moitié centrale des scores de référence). La référence n'est pas le meilleur ni le pire score dynamique des modèles actuellement classés ; l'ajout d'un score extrême ne réétire donc pas l'échelle des autres modèles. La calibration exige au moins quatre références valides et un écart interquartile supérieur à zéro ; à défaut, on attend d'avoirréférence valide. L'écart de score brut, après unification du sens, est divisé par l'intervalle interquartile figé, puis tronqué à −1 1. C'est un écart de score relatif, non une unité de capacité intrinsèque.
Le score est ajusté une fois l'ordre de référence déterminé : pour chaque paire de modèles évalués en commun, pondéré par la part de preuves communes W, l'écart de score se rapproche au maximum de l'écart de score moyen standardisé d, en minimisant Σ W·(xᵢ−xⱼ−dᵢⱼ)² ;avec la contrainte que x ne s'inverse pas par rapport à l'ordre publié. La moyenne des x des modèles de référence valides de ce cycle est fixée à 0, puis convertie par 100 / (1 + 9⁻ˣ) converti en 0–100 points, le centre de référence étant à 50, un écart d'une unité ajustée correspondant à 90 ou 10. Cette échelle est une convention publique, pas une probabilité mesurée. Les différentes catégories, cycles et versions de méthode ne se comparent pas directement ; l'ajout de preuves valides ou de modèles participants peut modifier les scores ajustés, sans recalcul sur la page de filtrage.
L'ajustement pondéré s'inspire de HodgeRank l'idée de comparaison par paires, ce classement contraint en outre l'ordre des scores. Il compresse les conflits et ne peut pas condenser fidèlement toutes les performances aux tâches en un seul chiffre. Les résultats d'ajustement, les références effectives et les résidus sont conservés par cycle de calcul ; aucun nouveau cycle n'est publié si les conditions d'une résolution valide ne sont pas réunies.
Lorsque l'erreur type est publiée, son information d'erreur est conservée ; sinon elle reste inconnue, n'est pas mise à zéro, et l'écart de score standardisé n'est pas présenté comme une probabilité. Les mesures manquantes ne sont comblées ni par zéro ni par la moyenne ; en cas de preuves communes insuffisantes ou non connectées, aucun ordre déterminé entre groupes n'est inventé. La proportion de couverture indique le poids des évaluations couvertes et ne peut pas être interprétée comme la contribution exacte au rang final de référence.
Le classement général exige au moins trois sources, trois familles de questions, trois institutions et trois domaines de compétence, ainsi que des scores directement comparables avec au moins deux références fixes. Une catégorie exige, selon les sources dont elle dispose, au maximum deux sources et deux institutions, et au moins une référence. Les modèles publiés depuis plus de dix-huit mois sortent du classement courant ; leur page de détail conserve un historique horodaté.
Sans données question par question, le nombre de paires de modèles déployées ne peut pas être pris pour une taille d'échantillon indépendante. Les scores publiés ne couvrent pas tous les biais possibles et ne remplacent pas l'étude des scores inconnus. Les scores ne s'accompagnent d'aucun niveau de confiance statistique non vérifié.
Modèles de référence fixes :claude-fable-5, gpt-5-6-sol, kimi-k-3, qwen-3-8-max, gpt-5-4, claude-opus-4-8, claude-sonnet-5, grok-4-5, gemini-3-5-flash, glm-5-2, claude-sonnet-4-6, qwen-3-7-max, kimi-k-2-6, deepseek-v-4-pro, qwen-3-6-plus, minimax-m-3, gpt-5-4-mini, grok-4-3. Le groupe de référence sert à calibrer l'échelle d'évaluation ; il n'indique à aucun fournisseur le rang qu'il devrait occuper. Il est figé et versionné avec le protocole d'évaluation, et re-vérifié en cas de changement de protocole.