Hugging Face intègre Mixtral 8x7B, un modèle MoE open source SOTA
Welcome Mixtral - a SOTA Mixture of Experts on Hugging Face
Mistral a publié Mixtral 8x7B, un modèle à mélange d'experts (MoE) qui établit un nouveau niveau SOTA pour les modèles open access et surpasse GPT-3.5 sur de nombreux benchmarks. Hugging Face annonce son intégration complète dans son écosystème : modèles sur le Hub sous licence Apache 2.0, support dans Transformers, Inference Endpoints, Text Generation Inference, et un exemple de fine-tuning sur un seul GPU avec TRL. Le modèle supporte une fenêtre de contexte de 32k tokens, parle anglais, français, allemand, espagnol et italien, et obtient 40,2 % sur HumanEval. Mixtral Instruct dépasse tous les autres modèles open access sur MT-Bench avec un score de 8,30, comparable à GPT-3.5.
L'article détaille l'intégration complète de Mixtral 8x7B dans l'écosystème Hugging Face, des points de déploiement à la quantification, utile pour évaluer les options d'inférence et de fine-tuning.
Source :Hugging Face Blog · huggingface.co