Argilla et Hugging Face lancent « Data is Better Together », une expérience de construction collective d'un dataset de préférences par classement de prompts.
Motif de la recommandation :Présente les trois tailles de StarCoder2, la taille des données d'entraînement et la divulgation complète des modèles, jeux de données et code d'entraînement.
Hugging Face annonce TTS Arena, un outil inspiré de Chatbot Arena qui permet de comparer côte à côte des modèles de synthèse vocale en soumettant un texte.
Motif de la recommandation :L'article détaille l'intégration complète de Gemma dans l'écosystème Hugging Face, du déploiement à l'affinage, avec des exemples de code exécutables.
Hugging Face détaille une méthode pour créer des données synthétiques avec le LLM open source Mixtral-8x7B-Instruct-v0.1 afin d'entraîner un petit modèle spécialisé.
Motif de la recommandation :Un cas concret de distillation par données synthétiques avec coûts, latence et émissions comparés à GPT-4, et des notebooks réutilisables.
Hugging Face introduit Messages API, qui apporte la compatibilité avec l'API OpenAI Chat Completion à Text Generation Inference (TGI) et Inference Endpoints à partir de la version 1.4.0 de TGI. L'API peut être utilisée directement avec les bibliothèques clientes d'OpenAI ou des outils tiers comme LangChain et LlamaIndex, et elle est disponible sur Inference Endpoints en versions dédiée et serverless. Elle ne prend pas encore en charge le function calling et ne fonctionne qu'avec les LLM disposant d'un chat_template défini dans la configuration de leur tokenizer, comme Mixtral 8x7B Instruct.
Motif de la recommandation :L'original détaille la compatibilité OpenAI de TGI et les étapes de migration, ce qui aide le lecteur à évaluer le coût de bascule vers des LLM ouverts.
Motif de la recommandation :SegMoE permet de créer des modèles de diffusion Mixture-of-Experts à partir de modèles pré-entraînés, avec un package et une intégration diffusers directement réutilisables.
Motif de la recommandation :L'article fournit une recette complète d'alignement Constitutional AI avec des modèles ouverts, incluant datasets, modèles et outil de génération à grande échelle.
Hugging Face présente le Hallucinations Leaderboard, une plateforme ouverte évaluant les LLM sur des benchmarks dédiés aux hallucinations via in-context learning.
Hugging Face et Google Cloud ont annoncé un partenariat stratégique pour démocratiser le machine learning et permettre aux entreprises de construire leur propre IA avec des modèles ouverts. Les clients de Google Cloud pourront entraîner et déployer les modèles Hugging Face via Google Kubernetes Engine (GKE) et Vertex AI, en s'appuyant sur les TPU, les VM A3 équipées de GPU NVIDIA H100 Tensor Core et les VM C3. Les utilisateurs du Hugging Face Hub bénéficieront du déploiement en production via Inference Endpoints et de l'accélération par TPU sur Hugging Face Spaces, avec des annonces prévues dès ce trimestre.
Motif de la recommandation :L'article détaille le fonctionnement interne des agents ReAct et fournit un benchmark comparant plusieurs LLM open source à GPT-3.5 et GPT-4.
Hugging Face publie un tutoriel pas à pas pour convertir un workflow ComfyUI en application Gradio et la déployer gratuitement sur Hugging Face Spaces via ZeroGPU. Le processus passe par l'extension ComfyUI-to-Python-Extension pour exporter le workflow en script Python, puis par la création d'une interface Gradio exposant prompt, image de structure, image de style et forces associées. Les modèles sont téléchargés depuis le Hub via hf_hub_download et préchargés hors de la fonction décorée par @spaces.GPU pour tirer parti du serverless. L'auteur indique qu'une automatisation complète du processus est prévue début 2025.
Unsloth, une bibliothèque légère développée par la communauté, accélère le fine-tuning des LLM jusqu'à 2x et réduit l'usage de mémoire jusqu'à 74% sans dégradation de précision.
Motif de la recommandation :L'article détaille les gains de vitesse et de mémoire d'Unsloth pour le fine-tuning, avec des benchmarks reproductibles et un exemple d'intégration à TRL.
Motif de la recommandation :aMUSEd adopte une méthode non-diffusion MIM, avec un poids d'environ 800M et une inférence rapide, et fournit un code d'entraînement et de fine-tuning, ce qui permet de comprendre la voie de génération d'images sans diffusion.
Motif de la recommandation :Le guide détaille les techniques SOTA de fine-tuning LoRA pour SDXL et fournit un script diffusers directement réutilisable.
Motif de la recommandation :L'article détaille l'implémentation du décodage spéculatif dans Transformers avec des benchmarks reproductibles, permettant de réduire de moitié le temps d'inférence de Whisper sans perte de précision.
Mistral a publié Mixtral 8x7B, un modèle à mélange d'experts (MoE) qui établit un nouveau niveau SOTA pour les modèles open access et surpasse GPT-3.5 sur de nombreux benchmarks. Hugging Face annonce son intégration complète dans son écosystème : modèles sur le Hub sous licence Apache 2.0, support dans Transformers, Inference Endpoints, Text Generation Inference, et un exemple de fine-tuning sur un seul GPU avec TRL. Le modèle supporte une fenêtre de contexte de 32k tokens, parle anglais, français, allemand, espagnol et italien, et obtient 40,2 % sur HumanEval. Mixtral Instruct dépasse tous les autres modèles open access sur MT-Bench avec un score de 8,30, comparable à GPT-3.5.
Motif de la recommandation :L'article détaille l'intégration complète de Mixtral 8x7B dans l'écosystème Hugging Face, des points de déploiement à la quantification, utile pour évaluer les options d'inférence et de fine-tuning.
Hugging Face publie une explication des Mixture of Experts (MoE), architecture mise en avant par la sortie de Mixtral 8x7B. L'article décrit les deux composants d'une couche MoE.
Motif de la recommandation :L'article détaille les briques, l'entraînement et les compromis de service des MoE, utile pour comprendre l'architecture derrière Mixtral 8x7B.
Motif de la recommandation :L'article détaille le support out-of-the-box des GPU AMD Instinct dans Transformers et TGI, avec des benchmarks face à l'A100.