Aller au contenu

TapTap Maker Benchmark

TapTap Maker / programmation · Écrire en Lua des fonctionnalités qui tournent dans un vrai moteur de jeu. Le score est déterminé par l'exécution dans le moteur, sans notation par un autre modèle.

Évaluation officielle
dans le Actu Créaflash surÀ titre indicatif
Budget de preuvesHors classement
Date des données amont09/10 08:00
Dernière synchronisation réussie10/03 20:40

Ce qu'il mesure, comment il le mesure

On ne retient que le main officiel_board du taux de réussite L2 ; le coût, la vitesse, le Held-out et les scores par catégorie ne sont pas recomptés. Pour un même modèle de base, la ligne représentative est choisie selon une priorité fixe des niveaux de raisonnement, sans tenir compte du score.

Comment utiliser ces preuves

À titre indicatif : les résultats actuels mélangent différents agent drivers et ne permettent pas de comparer les modèles sous-jacents dans un même flux d'exécution.

Scores d'évaluation

Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.

Rang sur le classement d'origineModèle au classement d'origineScore brutConfiguration de référence
1claude-fable-5-1Anthropic90.5%High « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
2claude-fable-5Anthropic89.0%High « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
3gpt-6-astraOpenAI88.9%xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
4claude-opus-5Anthropic88.9%xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
5muse-spark-1.3-contributorMeta87.3%xHigh « inférence »Non pris en compte :L'alias de contributeur de la source ne correspond à aucun modèle public vérifié.
6grok-4.6@xhighxAI87.3%xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
7gemini-3.8-flashGoogle86.8%High « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
8gpt-5.6-solOpenAI86.5%xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
11glm-5.3Z.ai83.6%Max « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
12qwen3.8-max-0902Alibaba83.3%xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
13claude-opus-4-8Anthropic82.8%xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
14qwen3.8-maxAlibaba82.5%xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
15deepseek-v4.1-flashDeepSeek82.5%Max « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
16qwen3.8-flashAlibaba82.5%xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
17gpt-5.6-terraOpenAI81.8%xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
18glm-5.3-flashZ.ai81.5%Max « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
19hy4-previewTencent81.0%High « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
20kimi-k3Moonshot AI79.7%Configuration par défaut de la sourceNon pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
21grok-4.5xAI78.3%High « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
22doubao-seed-evolvingByteDance78.3%High « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
23gpt-5.6-lunaOpenAI77.8%xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
24deepseek-v4-proDeepSeek77.8%Configuration par défaut de la sourceNon pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
25claude-sonnet-5Anthropic76.2%xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
27deepseek-v4-flashDeepSeek74.6%Max « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
28qwen3.8-27bAlibaba68.3%xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
29gemini-3.1-pro-previewGoogle64.7%Configuration par défaut de la sourceNon pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
30MiniMax-M3MiniMax60.1%Configuration par défaut de la sourceNon pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
31claude-haiku-4-5Anthropic43.6%High « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes.
Limites de l'évaluation et attribution des données

Un seul moteur, un seul langage : impossible de généraliser à d'autres stacks techniques ; différents modèles peuvent utiliser différents agent drivers ; le harness fermé ne permet pas de recalculer tâche par tâche. Les drivers d'exécution actuellement utilisés étant différents, ils ne sont pas pris en compte dans le classement par modèle.

Licence des données :résultats publics officiels ; toute réutilisation publique conserve l'attribution officielle ; l'autorisation de rediffusion complète dépend encore des conditions d'utilisation de TapTap

Résultats publiés par TapTap Maker ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.