Aller au contenu

Calcul du classement

Comprendre comment le score Actu Créaflash est calculé, ainsi que les résultats publics derrière chaque score.

EVIDENCE BEFORE CONCLUSIONS

D'abord le score, ensuite les points forts.

Le classement général et les quatre classements thématiques affichent au maximum 30 modèles.Actu Créaflash Le score facilite une comparaison rapide ; les sous-scores montrent les points forts de chacun et la couverture des preuves indique l'étendue des évaluations disponibles.

Le score est un indice de comparaison globale calculé à partir d'évaluations publiques ; ce n'est pas un taux de bonnes réponses et il ne reflète pas la capacité absolue sur toutes les tâches. Pour un usage précis, consultez les résultats bruts des sous-scores et la configuration d'exécution.

  1. 01

    Vérifier d'abord le modèle et la configuration d'exécution

    Unifier le nom du modèle, la version et la configuration d'inférence, puis choisir l'exécution représentative selon des règles fixées à l'avance, sans retenir le meilleur score. Une exécution avec outils fixes et un même modèle du début à la fin est acceptée ; les systèmes à repli multi-modèles, à modèles mélangés ou à agents hétérogènes propriétaires ne sont pas classés ensemble. Si la configuration n'est pas publiée, l'inconnu est conservé et l'on n'en conclut pas qu'il y a mélange de modèles.

  2. 02

    Répartir par capacité, sans pondérer les preuves redondantes

    Le classement général répartit à poids égal entre huit dimensions de capacité, chacune comptant pour 12.5%. Au sein d'une dimension, la pondération est ensuite répartie entre les familles de questions ; les résultats répétés d'une même banque de questions, les extraits de classement et les indicateurs composites déjà pris en compte ne sont pas pondérés une seconde fois. Toute nouvelle évaluation est d'abord vérifiée quant aux chevauchements de questions et de protocoles.

  3. 03

    Calibrer les écarts réels avec une référence de même protocole

    Ne comparer que les résultats que les deux modèles possèdent sous un même protocole d'évaluation, et calibrer les écarts continus à l'aide de l'écart interquartile d'un groupe de référence fixé à l'avance, afin de ne pas traiter un petit écart et un grand écart comme une même voix. Les mesures manquantes ne sont pas compensées, et une erreur standard inconnue n'est pas ramenée à zéro.

  4. 04

    Convertir en score pour faciliter la comparaison

    Agréger les écarts de résultats relatifs des évaluations communes et rechercher un ordre de référence présentant le moins de conflits. Tout en conservant cet ordre, ajuster les écarts de résultats communs sur une échelle de 0–100 de Actu Créaflash score ; les résultats bruts de chaque évaluation restent disponibles pour vérification.

A BALANCED VIEW

Huit dimensions de capacité, à parts égales.

Codage, mathématiques et raisonnement, connaissances et faits, compréhension du langage et instructions, rédaction et expression, compréhension visuelle, tâches professionnelles, chinois et multilinguisme représentent chacun 12.5%. Il s'agit d'un choix public d'équilibre, et non du poids naturel des capacités générales. Chaque dimension reçoit d'abord une part de familles de questions, puis les évaluations internes à chaque famille sont traitées ; une question répétée n'augmente pas le poids total. Lorsque des sous-scores sont déjà utilisés, les indicateurs composites qui les incluent ne sont pas comptés une seconde fois. Une part manquante n'est pas reportée sur d'autres preuves.

  • programmation12.5%Participent cette passe :DeepSWE v1.1 · LiveBench · Programmation générale
  • Mathématiques et raisonnement12.5%Participent cette passe :LiveBench · Raisonnement et mathématiques · FrontierMath v2 · Tiers 1–3 · FrontierMath v2 · Tier 4 · Chess Puzzles · Mystery Game Puzzles
  • Connaissances et faits12.5%Participent cette passe :SimpleQA Verified · GPQA Diamond
  • Compréhension du langage et instructions12.5%Participent cette passe :LiveBench · Langage et instructions
  • Rédaction et expression12.5%Participent cette passe :Arena Création en aveugle · Creative Writing v3 · Longform Writing
  • Compréhension visuelle12.5%Participent cette passe :Arena Vision
  • Tâches professionnelles sectorielles12.5%Participent cette passe :APEX-Agents 1.1 · Vals Finance Agent
  • Chinois et multilinguisme12.5%Aucune preuve comptabilisable pour cette passe

Les quatre classements — codage, raisonnement, connaissances et travail professionnel — conservent une entrée distincte et ne comparent que les résultats publics de la capacité correspondante ; les scores par catégorie et les positions de référence ne se comparent pas d'une catégorie à l'autre. Des évaluations publiques issues du même organisme ne comptent pas comme plusieurs organismes indépendants. Des évaluations supplémentaires n'ont de valeur que si elles apportent des preuves valides différentes ; le nombre en lui-même n'augmente pas la part totale d'une dimension de capacité.

Vous voulez peut-être aussi savoir

Actu Créaflash score : comment le lire ?
0–100 points, plus le score est élevé, plus la performance globale du modèle dans ce classement est forte. Le score est ajusté à partir des écarts réels des évaluations communes : il n'est pas obtenu en retirant des points rang par rang, et le premier n'obtient pas automatiquement le maximum. Ce n'est ni un taux de réussite ni un taux de victoire ; comparez toujours au sein du même classement et de la même édition.
Pourquoi des rangs différents peuvent-ils avoir le même score ?
Le score n'affiche qu'une décimale ; lorsque l'écart est très faible, ou que les différentes évaluations se contredisent et ne peuvent pas être entièrement exprimées par un seul score, les scores peuvent être identiques. L'ordre reste alors celui des évaluations communes, sans inventer un écart de 0.1 point.
Le rang de référence indique-t-il qui est forcément plus fort ?
Non. Il s'agit de l'ordre de consultation des résultats publics actuels selon des règles données, et non d'un classement absolu des capacités sur toutes les tâches du monde. L'expérience réelle dépend aussi de la version du produit, du budget d'inférence, de l'environnement d'outils et du type de tâche. Des rangs voisins n'impliquent pas un écart significatif.
Qu'est-ce que le pourcentage de couverture des preuves ?
Il indique quelle part des pondérations d'évaluation prédéfinies est couverte par les résultats déjà disponibles pour ce modèle. Une couverture élevée signifie que la zone connue est plus large ; cela ne veut pas dire que le modèle est plus capable, et ce n'est pas un taux de réussite. Les parts manquantes ne sont pas reportées sur d'autres évaluations, ni comblées par des zéros ou des moyennes.
L'écart de résultats relatifs des évaluations communes est-il un taux de victoire ?
Non. Il agrège les écarts continus, calibrés sur une référence fixe, dans les évaluations communes aux deux modèles ; le signe indique seulement la direction relative, pas une probabilité de victoire ni une avance significative. Les comparaisons par paires peuvent se contredire ; l'ordre de référence complet doit traiter ces relations simultanément.
Pourquoi ne pas simplement retenir le meilleur résultat de chaque modèle ?
Le meilleur résultat peut correspondre à un budget d'inférence plus élevé, à d'autres outils ou à un autre protocole d'évaluation. Les règles de choix de la configuration représentative doivent être fixées à l'avance : on ne choisit pas le score après avoir vu les résultats. Un même nom de palier d'inférence ne garantit pas un volume de calcul identique ; la configuration exacte est conservée à côté du résultat.
Peut-on éliminer totalement les doublons, la contamination et les erreurs des évaluations ?
Non. Nous vérifions les doublons d'après les banques de questions et les protocoles publics, et limitons la part d'une même famille de questions ; les chevauchements de questions non vérifiables et la contamination par l'entraînement restent des limites. Lorsque les résultats par échantillon ou l'erreur standard ne sont pas publiés en amont, il est impossible de reconstituer une erreur fiable, et l'inconnu n'est pas traité comme zéro.
Quand un nouveau modèle apparaît-il ?
Actu Créaflash Les résultats des sources sont vérifiés quatre fois par jour. Seuls les scores d'un nouveau modèle réellement publiés par l'évaluateur peuvent entrer dans l'ordre de référence ; un rafraîchissement de page, une mise à jour de prix ou notre heure de collecte ne comptent pas comme une nouvelle évaluation.
Que se passe-t-il si un classement est temporairement inaccessible ?
Les instantanés de source encore valides restent utilisables. Au sein d'une même version d'évaluation, une ligne temporairement manquante peut prolonger au maximum les enregistrements vérifiés des sept derniers jours ; un score valide encore présent dans un classement public n'est pas supprimé parce que sa valeur reste longtemps inchangée. Un retrait, une correction ou un changement de version officiel entraîne l'expiration ou le remplacement correspondant, sans conserver le meilleur score historique. Si le calcul d'une passe entière échoue, le classement valide de la passe précédente et son horodatage d'origine sont conservés.
Le prix ou la vitesse influencent-ils l'ordre de référence ?
Ni l'un ni l'autre. Le prix sert uniquement à connaître le coût d'usage de l'API : il est affiché de façon uniforme par million de Token et conserve la source officielle du fournisseur. Il ne représente pas le coût d'abonnement.
Voir les détails du calcul et la version actuelle

Version de méthode :2026.10-observed-evidence-v17. L'identité du modèle, la configuration représentative, le rattachement aux familles de questions, les pondérations des dimensions, le groupe de référence et les entrées de calcul sont tous versionnés. L'ordre de référence utilise un tri Kemeny incomplet pondéré, qui minimise les conflits avec les écarts de résultats des évaluations communes ; seuls sont publiés les résultats dont la résolution est optimale et qui remplissent les conditions d'éligibilité et de connexité. Il peut exister plusieurs ordres tout aussi optimaux ; l'ordre d'affichage fixe ne signifie pas que tous les modèles ont étéprécisément distingués, et une résolution mathématique optimale ne prouve pas non plus l'ordre réel des capacités.

Pour chaque évaluation, le protocole et le sens sont d'abord confirmés, puis les écarts de score continus sont calibrés à l'aide de l'écart interquartile du groupe de référence fixe sous le même protocole (l'étendue de la moitié centrale des scores de référence). La référence n'est pas le meilleur ni le pire score dynamique des modèles actuellement classés ; l'ajout d'un score extrême ne réétire donc pas l'échelle des autres modèles. La calibration exige au moins quatre références valides et un écart interquartile supérieur à zéro ; à défaut, on attend d'avoirréférence valide. L'écart de score brut, après unification du sens, est divisé par l'intervalle interquartile figé, puis tronqué à −1 1. C'est un écart de score relatif, non une unité de capacité intrinsèque.

Le score est ajusté une fois l'ordre de référence déterminé : pour chaque paire de modèles évalués en commun, pondéré par la part de preuves communes W, l'écart de score se rapproche au maximum de l'écart de score moyen standardisé d, en minimisant Σ W·(xᵢ−xⱼ−dᵢⱼ)² ;avec la contrainte que x ne s'inverse pas par rapport à l'ordre publié. La moyenne des x des modèles de référence valides de ce cycle est fixée à 0, puis convertie par 100 / (1 + 9⁻ˣ) converti en 0–100 points, le centre de référence étant à 50, un écart d'une unité ajustée correspondant à 90 ou 10. Cette échelle est une convention publique, pas une probabilité mesurée. Les différentes catégories, cycles et versions de méthode ne se comparent pas directement ; l'ajout de preuves valides ou de modèles participants peut modifier les scores ajustés, sans recalcul sur la page de filtrage.

L'ajustement pondéré s'inspire de HodgeRank l'idée de comparaison par paires, ce classement contraint en outre l'ordre des scores. Il compresse les conflits et ne peut pas condenser fidèlement toutes les performances aux tâches en un seul chiffre. Les résultats d'ajustement, les références effectives et les résidus sont conservés par cycle de calcul ; aucun nouveau cycle n'est publié si les conditions d'une résolution valide ne sont pas réunies.

Lorsque l'erreur type est publiée, son information d'erreur est conservée ; sinon elle reste inconnue, n'est pas mise à zéro, et l'écart de score standardisé n'est pas présenté comme une probabilité. Les mesures manquantes ne sont comblées ni par zéro ni par la moyenne ; en cas de preuves communes insuffisantes ou non connectées, aucun ordre déterminé entre groupes n'est inventé. La proportion de couverture indique le poids des évaluations couvertes et ne peut pas être interprétée comme la contribution exacte au rang final de référence.

Le classement général exige au moins trois sources, trois familles de questions, trois institutions et trois domaines de compétence, ainsi que des scores directement comparables avec au moins deux références fixes. Une catégorie exige, selon les sources dont elle dispose, au maximum deux sources et deux institutions, et au moins une référence. Les modèles publiés depuis plus de dix-huit mois sortent du classement courant ; leur page de détail conserve un historique horodaté.

Sans données question par question, le nombre de paires de modèles déployées ne peut pas être pris pour une taille d'échantillon indépendante. Les scores publiés ne couvrent pas tous les biais possibles et ne remplacent pas l'étude des scores inconnus. Les scores ne s'accompagnent d'aucun niveau de confiance statistique non vérifié.

Modèles de référence fixes :claude-fable-5, gpt-5-6-sol, kimi-k-3, qwen-3-8-max, gpt-5-4, claude-opus-4-8, claude-sonnet-5, grok-4-5, gemini-3-5-flash, glm-5-2, claude-sonnet-4-6, qwen-3-7-max, kimi-k-2-6, deepseek-v-4-pro, qwen-3-6-plus, minimax-m-3, gpt-5-4-mini, grok-4-3. Le groupe de référence sert à calibrer l'échelle d'évaluation ; il n'indique à aucun fournisseur le rang qu'il devrait occuper. Il est figé et versionné avec le protocole d'évaluation, et re-vérifié en cas de changement de protocole.

Voir chaque preuve d'évaluation → →