Hugging Face : l'actualité de la communauté open source — modèles et jeux de données populaires, évolutions du classement et baromètre de l'écosystème open source.
188 sélections30 derniers jours 8 entréesTotal : 541 entrées
Motif de la recommandation :L'article détaille l'implémentation de RLOO dans TRL, avec des comparaisons de mémoire et de vitesse face à PPO, utile pour choisir une méthode d'entraînement RLHF.
Stable Diffusion 3 Medium (2B paramètres) de Stability AI est disponible sur le Hugging Face Hub et utilisable avec Diffusers. Le modèle repose sur une architecture MMDiT avec trois encodeurs de texte (CLIP L/14, OpenCLIP bigG/14, T5-v1.1-XXL) et un autoencodeur 16 canaux, entraîné avec un objectif de rectified flow matching. L'intégration Diffusers inclut des optimisations mémoire (offloading CPU, suppression de l'encodeur T5, quantification 8 bits via bitsandbytes) permettant de réduire la consommation de 18,7 Go à 4,3 Go, ainsi que des scripts de fine-tuning DreamBooth et LoRA.
Motif de la recommandation :Le billet détaille l'intégration de SD3 Medium dans Diffusers, avec optimisations mémoire et scripts de fine-tuning LoRA directement réutilisables.
Motif de la recommandation :Falcon 2 11B est publié en version LLM et VLM, avec les détails d'entraînement et les résultats d'évaluation pour situer ses performances.
Hugging Face publie Transformers Agents 2.0, qui introduit deux nouveaux agents capables d'itérer à partir d'observations passées pour résoudre des tâches complexes.
Motif de la recommandation :Le cadre d'agents open source expose la séparation entre moteur LLM et type d'agent, ainsi que les résultats comparés de Llama-3-70B et GPT-4 sur GAIA.
Hugging Face publie StarCoder2-15B-Instruct-v0.1, présenté comme le premier LLM de code entièrement auto-aligné entraîné via un pipeline transparent et permissif. Le modèle génère lui-même des paires instruction-réponse à partir de StarCoder2-15B, sans annotation humaine ni distillation de LLM propriétaires, et atteint 72,6 sur HumanEval, surpassant les 72,0 de CodeLlama-70B-Instruct. Sur LiveCodeBench, il devance même la version du même modèle entraînée sur des données distillées de GPT-4, ce qui suggère qu'un LLM apprend plus efficacement sur sa propre distribution. Les datasets et l'intégralité du pipeline sont open source.
Motif de la recommandation :Le pipeline entièrement ouvert et l'auto-alignement sans données distillées de GPT-4 permettent de reproduire et d'adapter la méthode à d'autres modèles de code.
Hugging Face publie JAT (Jack of All Trades), un agent Transformer unique entraîné sur un dataset de centaines de milliers de trajectoires d'experts couvrant Atari.
Motif de la recommandation :L'article détaille l'architecture et les résultats d'un agent Transformer unique couvrant jeux vidéo, robotique et navigation, avec dataset et modèles ouverts.
Motif de la recommandation :Idefics2, avec 8B de paramètres et une licence Apache 2.0, atteint des performances comparables à des modèles de 30B et plus sur plusieurs benchmarks, ce qui permet de situer les capacités des modèles multimodaux ouverts de cette taille.
Hugging Face présente la quantification des embeddings comme une étape de post-traitement qui réduit la mémoire et le stockage sans réduire la dimensionnalité. La quantification binaire convertit les valeurs float32 en 1 bit, soit une réduction de 32x, et permet de conserver environ 96 % des performances de retrieval grâce à une étape de rescoring avec l'embedding de requête float32 ; la quantification scalaire en int8 réduit la taille de 4x et atteint environ 99 % des performances avec un rescore_multiplier de 4 à 5. Sur un benchmark MTEB Retrieval, la quantification binaire offre un gain de vitesse moyen de 24,76x et la quantification int8 de 3,66x. Une démo combine recherche binaire et rescoring int8 sur 41 millions de textes Wikipédia, avec 5,2 Go de mémoire et 52 Go d'espace disque contre 200 Go pour un retrieval float32 classique. Le code est disponible via Sentence Transformers et des scripts d'exemple.
Motif de la recommandation :L'article détaille les principes et le code de la quantification binaire et scalaire des embeddings, avec des gains de vitesse et de coût mesurés sur 41 millions de textes.
Hugging Face présente Cosmopedia, un jeu de données synthétiques de plus de 30 millions de fichiers et 25 milliards de tokens généré par Mixtral-8x7B-Instruct-v0.1.
Motif de la recommandation :L'article détaille la construction d'un jeu de données synthétiques de 25 milliards de tokens, avec la méthode de génération des prompts et la pile technique, utile pour ceux qui veulent reproduire ce type de données.
Le blog Hugging Face présente GaLore, une méthode qui projette les gradients dans un sous-espace de bas rang pour réduire la mémoire des états d'optimiseur de plus de 82.
Motif de la recommandation :L'article détaille la réduction de plus de 82,5 % de la mémoire des états d'optimiseur et fournit un exemple exécutable avec transformers, utile pour l'entraînement sur GPU grand public.
Hugging Face annonce TTS Arena, un outil inspiré de Chatbot Arena qui permet de comparer côte à côte des modèles de synthèse vocale en soumettant un texte.
Motif de la recommandation :L'article détaille l'intégration complète de Gemma dans l'écosystème Hugging Face, du déploiement à l'affinage, avec des exemples de code exécutables.
Hugging Face détaille une méthode pour créer des données synthétiques avec le LLM open source Mixtral-8x7B-Instruct-v0.1 afin d'entraîner un petit modèle spécialisé.
Motif de la recommandation :Un cas concret de distillation par données synthétiques avec coûts, latence et émissions comparés à GPT-4, et des notebooks réutilisables.
Hugging Face introduit Messages API, qui apporte la compatibilité avec l'API OpenAI Chat Completion à Text Generation Inference (TGI) et Inference Endpoints à partir de la version 1.4.0 de TGI. L'API peut être utilisée directement avec les bibliothèques clientes d'OpenAI ou des outils tiers comme LangChain et LlamaIndex, et elle est disponible sur Inference Endpoints en versions dédiée et serverless. Elle ne prend pas encore en charge le function calling et ne fonctionne qu'avec les LLM disposant d'un chat_template défini dans la configuration de leur tokenizer, comme Mixtral 8x7B Instruct.
Motif de la recommandation :L'original détaille la compatibilité OpenAI de TGI et les étapes de migration, ce qui aide le lecteur à évaluer le coût de bascule vers des LLM ouverts.
Motif de la recommandation :SegMoE permet de créer des modèles de diffusion Mixture-of-Experts à partir de modèles pré-entraînés, avec un package et une intégration diffusers directement réutilisables.
Motif de la recommandation :L'article fournit une recette complète d'alignement Constitutional AI avec des modèles ouverts, incluant datasets, modèles et outil de génération à grande échelle.
Motif de la recommandation :L'article détaille le fonctionnement interne des agents ReAct et fournit un benchmark comparant plusieurs LLM open source à GPT-3.5 et GPT-4.
Hugging Face publie un tutoriel pas à pas pour convertir un workflow ComfyUI en application Gradio et la déployer gratuitement sur Hugging Face Spaces via ZeroGPU. Le processus passe par l'extension ComfyUI-to-Python-Extension pour exporter le workflow en script Python, puis par la création d'une interface Gradio exposant prompt, image de structure, image de style et forces associées. Les modèles sont téléchargés depuis le Hub via hf_hub_download et préchargés hors de la fonction décorée par @spaces.GPU pour tirer parti du serverless. L'auteur indique qu'une automatisation complète du processus est prévue début 2025.
Unsloth, une bibliothèque légère développée par la communauté, accélère le fine-tuning des LLM jusqu'à 2x et réduit l'usage de mémoire jusqu'à 74% sans dégradation de précision.
Motif de la recommandation :L'article détaille les gains de vitesse et de mémoire d'Unsloth pour le fine-tuning, avec des benchmarks reproductibles et un exemple d'intégration à TRL.
Motif de la recommandation :aMUSEd adopte une méthode non-diffusion MIM, avec un poids d'environ 800M et une inférence rapide, et fournit un code d'entraînement et de fine-tuning, ce qui permet de comprendre la voie de génération d'images sans diffusion.