TapTap Maker Benchmark
TapTap Maker / programmation · Écrire en Lua des fonctionnalités qui tournent dans un vrai moteur de jeu. Le score est déterminé par l'exécution dans le moteur, sans notation par un autre modèle.
Ce qu'il mesure, comment il le mesure
On ne retient que le main officiel_board du taux de réussite L2 ; le coût, la vitesse, le Held-out et les scores par catégorie ne sont pas recomptés. Pour un même modèle de base, la ligne représentative est choisie selon une priorité fixe des niveaux de raisonnement, sans tenir compte du score.
Comment utiliser ces preuves
À titre indicatif : les résultats actuels mélangent différents agent drivers et ne permettent pas de comparer les modèles sous-jacents dans un même flux d'exécution.
Scores d'évaluation
Selon des règles fixes, chaque modèle public utilise une configuration représentative ; les modèles sans configuration admissible sont marqués comme non pris en compte, avec la raison indiquée. Les modèles testés de façon anonyme ne sont pas affichés, leur rang d'origine est conservé, avec un maximum de 30 par entrée.
| Rang sur le classement d'origine | Modèle au classement d'origine | Score brut | Configuration de référence |
|---|---|---|---|
| 1 | claude-fable-5-1Anthropic | 90.5% | High « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 2 | claude-fable-5Anthropic | 89.0% | High « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 3 | gpt-6-astraOpenAI | 88.9% | xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 4 | claude-opus-5Anthropic | 88.9% | xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 5 | muse-spark-1.3-contributorMeta | 87.3% | xHigh « inférence »Non pris en compte :L'alias de contributeur de la source ne correspond à aucun modèle public vérifié. |
| 6 | grok-4.6@xhighxAI | 87.3% | xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 7 | gemini-3.8-flashGoogle | 86.8% | High « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 8 | gpt-5.6-solOpenAI | 86.5% | xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 11 | glm-5.3Z.ai | 83.6% | Max « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 12 | qwen3.8-max-0902Alibaba | 83.3% | xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 13 | claude-opus-4-8Anthropic | 82.8% | xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 14 | qwen3.8-maxAlibaba | 82.5% | xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 15 | deepseek-v4.1-flashDeepSeek | 82.5% | Max « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 16 | qwen3.8-flashAlibaba | 82.5% | xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 17 | gpt-5.6-terraOpenAI | 81.8% | xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 18 | glm-5.3-flashZ.ai | 81.5% | Max « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 19 | hy4-previewTencent | 81.0% | High « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 20 | kimi-k3Moonshot AI | 79.7% | Configuration par défaut de la sourceNon pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 21 | grok-4.5xAI | 78.3% | High « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 22 | doubao-seed-evolvingByteDance | 78.3% | High « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 23 | gpt-5.6-lunaOpenAI | 77.8% | xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 24 | deepseek-v4-proDeepSeek | 77.8% | Configuration par défaut de la sourceNon pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 25 | claude-sonnet-5Anthropic | 76.2% | xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 27 | deepseek-v4-flashDeepSeek | 74.6% | Max « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 28 | qwen3.8-27bAlibaba | 68.3% | xHigh « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 29 | gemini-3.1-pro-previewGoogle | 64.7% | Configuration par défaut de la sourceNon pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 30 | MiniMax-M3MiniMax | 60.1% | Configuration par défaut de la sourceNon pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
| 31 | claude-haiku-4-5Anthropic | 43.6% | High « inférence »Non pris en compte :Les différents modèles utilisent des agents différents ; ces résultats ne peuvent pas être considérés comme des scores mono-modèle à conditions uniformes. |
Limites de l'évaluation et attribution des données
Un seul moteur, un seul langage : impossible de généraliser à d'autres stacks techniques ; différents modèles peuvent utiliser différents agent drivers ; le harness fermé ne permet pas de recalculer tâche par tâche. Les drivers d'exécution actuellement utilisés étant différents, ils ne sont pas pris en compte dans le classement par modèle.
Licence des données :résultats publics officiels ; toute réutilisation publique conserve l'attribution officielle ; l'autorisation de rediffusion complète dépend encore des conditions d'utilisation de TapTap
Résultats publiés par TapTap Maker ; les scores bruts de chaque épreuve utilisent des échelles différentes et ne peuvent pas être additionnés directement ; le rang de référence applique des règles publiques de normalisation des écarts.