Classement des modèles
AI Classement des modèles
De l'écriture de code à la modification de dépôts, pour voir si un modèle peut produire un logiciel.
2 évaluations·2 organismes·10/03 20:40 mise à jour
programmationclassement28 modèles
| Référence Rang | modèle | ||
|---|---|---|---|
| 01 | Claude Fable 5AnthropicAnthropic · 6mois9jourmise en ligne | 2 évaluationscouvre 100% | 79.0couvre 100% |
| 02 | Claude Opus 5AnthropicAnthropic · 7mois24jourmise en ligne | 2 évaluationscouvre 100% | 77.1couvre 100% |
| 03 | GPT-5.6 SolOpenAIOpenAI · 7mois9jourmise en ligne | 2 évaluationscouvre 100% | 73.4couvre 100% |
| 04 | Kimi K3Poids open source ↗Moonshot AIMoonshot AI · 7mois16jourmise en ligne | 2 évaluationscouvre 100% | 72.2couvre 100% |
| 05 | GPT-6 AstraOpenAIOpenAI · 9mois3jourmise en ligne | 2 évaluationscouvre 100% | 68.8couvre 100% |
| 06 | GLM-5.3Poids open source ↗Z.aiZ.ai · 8mois18jourmise en ligne | 2 évaluationscouvre 100% | 66.8couvre 100% |
| 07 | GPT-5.5OpenAIOpenAI · 4mois23jourmise en ligne | 2 évaluationscouvre 100% | 64.3couvre 100% |
| 08 | Gemini 3.7 FlashGoogleGoogle · 8mois13jourmise en ligne | 2 évaluationscouvre 100% | 61.1couvre 100% |
| 09 | GPT-5.6 LunaOpenAIOpenAI · 7mois9jourmise en ligne | 2 évaluationscouvre 100% | 59.4couvre 100% |
| 10 | GPT-5.6 TerraOpenAIOpenAI · 7mois9jourmise en ligne | 2 évaluationscouvre 100% | 59.4couvre 100% |
| 11 | GLM-5.3 FlashPoids open source ↗Z.aiZ.ai · 8mois26jourmise en ligne | 2 évaluationscouvre 100% | 58.0couvre 100% |
| 12 | Grok 4.6xAIxAI · 8mois12jourmise en ligne | 2 évaluationscouvre 100% | 56.4couvre 100% |
| 13 | Claude Sonnet 5AnthropicAnthropic · 6mois30jourmise en ligne | 2 évaluationscouvre 100% | 56.2couvre 100% |
| 14 | Gemini 3.8 FlashGoogleGoogle · 9mois2jourmise en ligne | 2 évaluationscouvre 100% | 50.8couvre 100% |
| 15 | Claude Opus 4.8AnthropicAnthropic · 5mois28jourmise en ligne | 2 évaluationscouvre 100% | 50.8couvre 100% |
| 16 | Qwen3.8 MaxAlibabaAlibaba · 7mois19jourmise en ligne | 2 évaluationscouvre 100% | 47.7couvre 100% |
| 17 | Muse Spark 1.2MetaMeta · 8mois5jourmise en ligne | 2 évaluationscouvre 100% | 47.7couvre 100% |
| 18 | Muse Spark 1.1MetaMeta · 7mois9jourmise en ligne | 2 évaluationscouvre 100% | 47.0couvre 100% |
| 19 | GPT-5.4OpenAIOpenAI · 3mois5jourmise en ligne | 2 évaluationscouvre 100% | 41.2couvre 100% |
| 20 | GLM-5.2Poids open source ↗Z.aiZ.ai · 6mois16jourmise en ligne | 2 évaluationscouvre 100% | 39.0couvre 100% |
| 21 | Grok 4.5xAIxAI · 7mois8jourmise en ligne | 2 évaluationscouvre 100% | 32.1couvre 100% |
| 22 | Gemini 3.6 FlashGoogleGoogle · 7mois21jourmise en ligne | 2 évaluationscouvre 100% | 29.2couvre 100% |
| 23 | Gemini 3.5 FlashGoogleGoogle · 5mois19jourmise en ligne | 2 évaluationscouvre 100% | 29.2couvre 100% |
| 24 | Claude Sonnet 4.6AnthropicAnthropic · 2mois17jourmise en ligne | 2 évaluationscouvre 100% | 26.0couvre 100% |
| 25 | DeepSeek V4 Pro PreviewPoids open source ↗DeepSeekDeepSeek · 4mois24jourmise en ligne | 2 évaluationscouvre 100% | 26.0couvre 100% |
| 26 | Kimi K2.7 CodePoids open source ↗Moonshot AIMoonshot AI · 6mois12jourmise en ligne | 2 évaluationscouvre 100% | 19.9couvre 100% |
| 27 | Gemini 3.1 Pro PreviewGoogleGoogle · 2mois19jourmise en ligne | 2 évaluationscouvre 100% | 19.9couvre 100% |
| 28 | DeepSeek V4 Flash PreviewPoids open source ↗DeepSeekDeepSeek · 4mois24jourmise en ligne | 2 évaluationscouvre 100% | 18.3couvre 100% |
Parmi les dix premiers du classement général de référence, pas encore auprogrammationclassement :Claude Opus 5.5(déjà 1 évaluations comparables), Claude Fable 5.1(déjà 1 évaluations comparables), GPT-6.1 Sol(déjà 1 évaluations comparables), Muse Spark 1.3(déjà 1 évaluations comparables). Le classement par catégorie ne compare que les modèles ayant passé des évaluations du même type ; il faut généralement deux évaluations issues de deux organismes.
Actu Créaflash a une note de 0–100 points ; plus la valeur est élevée, meilleure est la performance globale dans ce classement. À score égal, le tri suit la position de référence ; après filtrage, la note et la position du classement d'origine sont conservées, avec 30 modèles affichés au maximum.
La note sert à comparer au sein d'un même classement et d'une même session ; ce n'est pas un taux de réussite. Les résultats bruts de chaque évaluation sont consultables dans la fiche du modèle.
Comment lire ce classement
Actu Créaflash Plus le score est élevé, plus la performance globale dans ce classement est forte ; le score n'est pas un taux de bonnes réponses ; consultez les scores par épreuve pour le détail des capacités.Le prix n'entre pas dans le tri et les tests manquants ne sont pas compensés. Pour juger des capacités, tenez compte des résultats bruts par sous-test et de la configuration d'exécution.
En savoir plus sur la méthode de calcul →À propos des prix
API Les prix proviennent du site officiel du fabricant et sont affichés par million de Token.Les tarifs en dollars sont convertis au taux de change du 2026-10-02 en yuans.Le tarif de cache correspond au prix d'entrée en cas de hit de cache ; l'écriture du cache, son stockage et les frais d'abonnement sont facturés séparément.