Aller au contenu
Hugging Face Blog·· 2026-04-21AI Score40

QIMMA قِمّة : un leaderboard arabe LLM axé sur la qualité des benchmarks

QIMMA قِمّة ⛰: A Quality-First Arabic LLM Leaderboard

AI Introduction

Hugging Face présente QIMMA قِمّة, un leaderboard arabe de LLM qui valide la qualité des benchmarks avant d'évaluer les modèles. La plateforme agrège 109 sous-ensembles issus de 14 benchmarks, soit plus de 52 000 échantillons couvrant 7 domaines, avec 99 % de contenu natif arabe et la première évaluation de code en arabe via HumanEval+ et MBPP+. Le pipeline de validation, combinant Qwen3-235B-A22B-Instruct et DeepSeek-V3-671B puis une revue humaine, a écarté jusqu'à 3,1 % des échantillons d'ArabicMMLU, révélant des problèmes systématiques de réponses, de formatage et de sensibilité culturelle.

Source :Hugging Face Blog · huggingface.co