Hugging Face Blog·· 2026-04-21AI Score40
QIMMA قِمّة : un leaderboard arabe LLM axé sur la qualité des benchmarks
QIMMA قِمّة ⛰: A Quality-First Arabic LLM Leaderboard
AI Introduction
Hugging Face présente QIMMA قِمّة, un leaderboard arabe de LLM qui valide la qualité des benchmarks avant d'évaluer les modèles. La plateforme agrège 109 sous-ensembles issus de 14 benchmarks, soit plus de 52 000 échantillons couvrant 7 domaines, avec 99 % de contenu natif arabe et la première évaluation de code en arabe via HumanEval+ et MBPP+. Le pipeline de validation, combinant Qwen3-235B-A22B-Instruct et DeepSeek-V3-671B puis une revue humaine, a écarté jusqu'à 3,1 % des échantillons d'ArabicMMLU, révélant des problèmes systématiques de réponses, de formatage et de sensibilité culturelle.
Source :Hugging Face Blog · huggingface.co