Sources d'évaluation
Ce que mesure chaque source, comment elle est mise à jour et si elle entre dans le classement : tout est ici.
Évaluations globales et expérience
17Tests globaux multi-compétences et sélection à l'aveugle par des humains.
Référence croiséeAA IndexRepasse plusieurs évaluations actuelles dans un environnement commun pour obtenir un score de capacité globale. Le prix est donné à titre indicatif et n'entre pas dans le score total.Artificial Analysis
Référence croiséeLiveBenchLe jeu de questions est renouvelé en continu et les réponses peuvent être vérifiées automatiquement. Sert à voir si un modèle tient bon après un changement de questions.LiveBenchRéférence croiséeArena TextDes humains comparent anonymement des réponses par paires, pour voir laquelle ils préfèrent lire. Complète l'expérience globale que les QCM ne montrent pas.LMArena
À titre indicatifArena WebDevLà aussi, sélection à l'aveugle par des humains : on compare l'ergonomie et la capacité de livraison des pages web.LMArena
ClasséLiveBench · Langage et instructionsLanguage + IF Moyenne des deux, à 50 % chacun.LiveBenchBudget de preuves 12.5%ClasséArena Création en aveugleDes humains évaluent à l'aveugle histoires, poèmes et autres expressions créatives, pour voir si l'œuvre captive les lecteurs.LMArenaBudget de preuves 6.3%
- DEn observationDesign Arena · Design visuelDes humains évaluent à l'aveugle des créations de design : pages web, interfaces, graphiques et diaporamas.Design Arena / Intelligence
En observationEQ-Bench 4 · Émotions et compréhension interpersonnelleComprendre les émotions des personnages, les besoins implicites et les préférences de communication au fil d'échanges multi-tours.EQ-Bench
- LEn observationShort-Story · NouvelleIntégrer naturellement des personnages, une intrigue et des exigences de style donnés dans une nouvelle complète.Lech Mazur
- TEn observationToneBench · Style et scriptsÉcrire un script vidéo dans le style d'un auteur donné, en évaluant l'accroche, la structure, l'expression et le rythme de narration.Towards AI
- TEn observationTubeLab · Scripts vidéoÉcrire des scripts pour différentes chaînes vidéo, en comparant l'organisation du récit, le style, le rythme et la clarté.TubeLab
- NEn observationNC Bench · Workflow d'écrivainAider les écrivains à réécrire, poursuivre, résumer, traduire et organiser leurs idées créatives.Novelcrafter
- OEn observationOpenVibeEval · Œuvres webComparer des œuvres web, l'accessibilité et les préférences en aveugle pour observer la performance de design selon les différents outils.OpenVibeEval
- SEn observationSVGBench · Comparaison à l'aveugle de graphiques vectorielsComparaison à l'aveugle de SVG sur des prompts identiques, pour évaluer la netteté visuelle et le rendu graphique.SVGBench
En observationRapidata SVGDes humains comparent les graphiques vectoriels générés par les modèles et évaluent directement la préférence visuelle.Rapidata
ClasséCreative Writing v3Création courte et expressionEQ-BenchBudget de preuves 3.1%
ClasséLongform WritingCohérence et complétude de longs récitsEQ-BenchBudget de preuves 3.1%
programmation
13De l'écriture de code à la modification de dépôts, pour voir si un modèle peut produire un logiciel.
ClasséDeepSWE v1.1Modifier des dépôts et corriger des bugs dans un environnement d'assistant de programmation unifié : ce qui est comparé, c'est le modèle de code lui-même.DataCurveBudget de preuves 4.2%
À titre indicatifTapTap MakerÉcrire en Lua des fonctionnalités qui tournent dans un vrai moteur de jeu. Le score est déterminé par l'exécution dans le moteur, sans notation par un autre modèle.TapTap Maker
ClasséLiveBench · Programmation généraleCoding + Agentic Coding Moyenne des deux, à 50 % chacun.LiveBenchBudget de preuves 8.3%- SEn observationHyper-τ-benchConstruire et tester, à partir de documents métier, un agent de service client fonctionnel.Sierra
- NEn observationSWE-rebenchCollecte continue de problèmes issus de dépôts réels, pour comparer la capacité des modèles à corriger du logiciel dans plusieurs langages de programmation.Nebius
- TEn observationLHTBUtiliser le terminal de façon continue sur de longues durées, pour accomplir des tâches d'ingénierie et d'outillage complexes.Tencent HY / Lehigh soit
- HÀ titre indicatifTerminal-Bench 4Conserver les résultats bruts des modèles associés à différents Agents sur les tâches en terminal, pour recoupement.Harbor / Terminal-Bench
À titre indicatifMirrorCodeReproduction logicielle de longue duréeEpoch AI
En observationCode MigrationMigration logicielle et refonte d'interfacesVals AI
En observationProgramBenchImplémentation et livraison de programmes completsVals AI
- CEn observationFrontierCodeQualité, tests et périmètre de modification des tâches sur dépôts réelsCognition
- PEn observationFrontierSWE v2Tâches d'ingénierie et de recherche de longue duréeProximal Labs
- WEn observationWeirdMLImplémenter des solutions d'apprentissage automatique sur des données inconnuesWeirdML
« inférence »
11Mathématiques, logique et règles inconnues : voir si un modèle peut résoudre des problèmes inédits.
ClasséLiveBench · Raisonnement et mathématiquesReasoning + Mathematics Moyenne des deux, à 50 % chacun.LiveBenchBudget de preuves 3.1%- SEn observationSimpleBenchDes questions de bon sens quotidien et de logique pour vérifier si le modèle identifie les contraintes réelles d'un problème.SimpleBench
ClasséFrontierMath v2 · Tiers 1–3Raisonnement mathématique de niveau rechercheEpoch AIBudget de preuves 1.6%
ClasséFrontierMath v2 · Tier 4Des problèmes de recherche mathématique plus difficilesEpoch AIBudget de preuves 1.6%
ClasséChess PuzzlesTrouver le bon coup à partir d'une position d'échecs décrite en texteEpoch AIBudget de preuves 3.1%
ClasséMystery Game PuzzlesDéduire la bonne action à partir de règles inconnuesEpoch AIBudget de preuves 3.1%
- MEn observationMathArena · ArXivLeanVérifier des preuves mathématiques avec LeanMathArena / ETH Zurich
- MEn observationMathArena · BrokenArXivDétecter et corriger les erreurs dans des preuves mathématiquesMathArena / ETH Zurich
- MEn observationMathArena · ArXivMathNouveaux problèmes tirés de publications de recherche récentes en mathématiquesMathArena / ETH Zurich
- AEn observationARC-AGI-2Apprendre et généraliser à partir de règles inconnuesARC Prize
- AEn observationARC-AGI-3Apprendre et généraliser à partir de règles inconnuesARC Prize
Connaissance
5Questions factuelles et connaissances scientifiques de niveau master : voir la maîtrise des connaissances et l'exactitude des réponses.
- GEn observationFACTS ParametricRépondre à des questions factuelles sur le monde sans outil de recherche, pour tester l'exactitude des connaissances du modèle.Google DeepMind / Kaggle
- CEn observationHumanity’s Last ExamConnaissances académiques et raisonnement de haut niveau, toutes disciplines confondues.CAIS / Scale AI
- PEn observationBullshitBench · Prémisse erronéeRepérer les prémisses erronées dans une question et voir si le modèle continue d'inventer en suivant l'erreur.Peter Gostev / BullshitBench
ClasséSimpleQA VerifiedExactitude factuelle sur des questions courtesEpoch AIBudget de preuves 6.3%
ClasséGPQA DiamondConnaissances en physique, chimie et biologie de niveau masterEpoch AIBudget de preuves 6.3%
Travail professionnel
19Analyse financière, conseil juridique et opérations bancaires : voir si les tâches professionnelles sont réalisables.
ClasséAPEX-Agents 1.1Des tâches longues de banque d'affaires, de conseil et de droit, pour voir si le modèle, en assistant, peut mener à bien un travail complet.MercorBudget de preuves 6.3%
ClasséVals Finance AgentDes tâches de bureau du quotidien d'un analyste financier, pour juger le travail sur les notes d'analyse et la modélisation.Vals AIBudget de preuves 6.3%
- DEn observationOfficeQA ProChercher, calculer et répondre à partir d'un grand volume de documents financiers réels.Databricks
- VEn observationHarvey Legal Agent BenchmarkTraite des documents juridiques et livre des fichiers relisibles au format Word, Excel, diaporama, etc.Vals AI / Harvey
- SEn observationMCP AtlasRéalise des tâches inter-logiciels en recherchant des informations, en manipulant des documents et des bases de données via de vrais services MCP.Scale AI
- FEn observationFinanceBenchmarkRéalise des tâches de tarification financière, de calcul de capital et de contrôle des risques, vérifiées par des valeurs numériques et l'exécution de code.FinanceBenchmark
- SEn observationPRBench · LegalRépond à des questions complexes issues du travail juridique réel, pour évaluer le jugement professionnel et la qualité de l'argumentation.Scale AI
- SEn observationPRBench · FinanceRépond à de vraies questions de décision financière, pour évaluer le jugement professionnel, le raisonnement et l'exposé des risques.Scale AI
- SEn observationSpreadsheetBench 2Réalise l'ensemble d'un travail sur tableur : modélisation financière, correction de classeurs et visualisation de données.SpreadsheetBench / Renmin University / AfterQuery
- AEn observationVending-Bench 2Gère une boutique simulée pendant un an : achats, négociations, stocks et tarification.Andon Labs
En attente de résultatsτ³-BankingEffectuer des opérations bancaires dans un environnement d'outils unifié ; évaluer la compréhension des règles, la communication client et l'accomplissement des tâches.SierraBudget de preuves 0%À titre indicatifEBR-benchApprendre de nouvelles règles et mobiliser la mémoire dans des tâches longuesEpoch AI
En observationExcel · EMBÉdition de tableaux et travail sur ExcelVals AI
En observationLegal ResearchRecherche juridique et argumentationVals AI
En observationTaxAgentBenchQuestions fiscales spécialiséesVals AI
En observationMedScribeRédaction et mise en forme de comptes rendus cliniquesVals AI
En observationBioMysteryBenchRaisonnement en recherche biologiqueVals AI
- ZEn observationAutomationBenchAutomatiser des tâches à travers les logiciels bureautiquesZapier
- HEn observationTerminal-Bench ScienceRéaliser des tâches de recherche dans un terminalHarbor
Compréhension visuelle
2Les preuves de compréhension d'images restent dans le classement global ; comprendre une image et produire un design esthétique sont deux capacités distinctes.
Chinois et multilinguisme
2Preuves complémentaires sur les bases linguistiques ; la performance en rédaction anglaise n'est pas prise pour une compétence en chinois.
En attente de résultatsAA Chinois / MultilingueÉvaluer séparément les performances en chinois et en multilingue, sans compter une seconde fois la capacité générale en anglais.Artificial AnalysisBudget de preuves 0%
- REn observationRWS M-GATE30 langues dont le chinois, évaluant grammaire et traductionRWS
“« En observation » signifie que les données, les conditions d'exécution ou les limites d'usage sont encore en cours de vérification ; ces modèles ne participent ni au classement combiné ni aux classements par catégorie. La collecte répétée d'une même évaluation et le découpage de son affichage n'ajoutent pas de poids ; les chevauchements de banques de questions entre évaluations différentes restent à vérifier en continu.