Hugging Face : l'actualité de la communauté open source — modèles et jeux de données populaires, évolutions du classement et baromètre de l'écosystème open source.
188 sélections30 derniers jours 8 entréesTotal : 541 entrées
mise à jour
Archives de la sélection · page 7
2 janviermar.121–140 entrées · Au total 188 entrées
Motif de la recommandation :Le guide détaille les techniques SOTA de fine-tuning LoRA pour SDXL et fournit un script diffusers directement réutilisable.
Mistral a publié Mixtral 8x7B, un modèle à mélange d'experts (MoE) qui établit un nouveau niveau SOTA pour les modèles open access et surpasse GPT-3.5 sur de nombreux benchmarks. Hugging Face annonce son intégration complète dans son écosystème : modèles sur le Hub sous licence Apache 2.0, support dans Transformers, Inference Endpoints, Text Generation Inference, et un exemple de fine-tuning sur un seul GPU avec TRL. Le modèle supporte une fenêtre de contexte de 32k tokens, parle anglais, français, allemand, espagnol et italien, et obtient 40,2 % sur HumanEval. Mixtral Instruct dépasse tous les autres modèles open access sur MT-Bench avec un score de 8,30, comparable à GPT-3.5.
Motif de la recommandation :L'article détaille l'intégration complète de Mixtral 8x7B dans l'écosystème Hugging Face, des points de déploiement à la quantification, utile pour évaluer les options d'inférence et de fine-tuning.
Hugging Face publie une explication des Mixture of Experts (MoE), architecture mise en avant par la sortie de Mixtral 8x7B. L'article décrit les deux composants d'une couche MoE.
Motif de la recommandation :L'article détaille les briques, l'entraînement et les compromis de service des MoE, utile pour comprendre l'architecture derrière Mixtral 8x7B.
Motif de la recommandation :L'article détaille le support out-of-the-box des GPU AMD Instinct dans Transformers et TGI, avec des benchmarks face à l'A100.
Hugging Face publie Optimum-NVIDIA, une bibliothèque d'inférence qui accélère l'inférence des LLM sur la plateforme NVIDIA en modifiant une seule ligne de code.
Motif de la recommandation :L'original expose le point d'entrée d'une ligne, le gain de débit et la prise en charge de FP8, ce qui permet de juger l'impact sur le déploiement existant.
Hugging Face a réduit le temps de démarrage à froid de l'inférence LoRA de 25 s à 3 s et le temps de réponse de 35 s à 13 s en gardant le modèle de base Stable Diffusion XL chargé et en échangeant les adaptateurs LoRA à la demande. Le Hub héberge environ 2500 LoRA publics, dont environ 92 % reposent sur Stable Diffusion XL Base 1.0, et cette mutualisation permet de servir des centaines de LoRA distincts avec moins de 5 GPU A10G. L'article détaille l'implémentation dans Diffusers avec load_lora_weights, fuse_lora, unload_lora_weights et unfuse_lora, ainsi que les temps de chargement et d'inférence mesurés sur T4 et A10G.
Motif de la recommandation :L'article détaille le mécanisme de mutualisation des adaptateurs LoRA et les gains mesurés, utile pour ceux qui déploient plusieurs modèles fine-tunés.
Motif de la recommandation :L'article détaille une méthode LoRA pour accélérer SDXL et SD 1.5 en 4 étapes, avec code, benchmarks et scripts d'entraînement directement réutilisables.
Motif de la recommandation :L'article détaille le workflow complet de collecte de données, de fine-tuning QLoRA et de déploiement local d'un copilote de code, avec des scripts et des configurations réutilisables.
Hugging Face publie @gradio/lite, une bibliothèque JavaScript qui s'appuie sur Pyodide pour exécuter des applications Gradio directement dans le navigateur.
Motif de la recommandation :Présente le fonctionnement sans serveur de Gradio dans le navigateur et ses limites de chargement, utile pour évaluer les options de déploiement.
Motif de la recommandation :L'article explique comment les chat templates stockent le format d'entraînement dans le tokenizer et évitent une dégradation silencieuse des performances.
Le blog Hugging Face présente DDPOTrainer, un nouvel outil de la bibliothèque TRL permettant de fine-tuner des modèles de diffusion comme Stable Diffusion par apprentissage par renforcement. DDPO modélise le processus de débruitage comme un processus de décision markovien et utilise PPO pour optimiser une fonction de récompense, par exemple un prédicteur esthétique entraîné sur le jeu de données AVA. L'article détaille l'installation (pip install trl[diffusers]), le script d'exemple ddpo.py, les hyperparamètres recommandés pour un entraînement sur GPU unique (200 époques, train_batch_size 3, learning rate 3e-4) et les limites actuelles, notamment la restriction aux modèles SD vanilla et la difficulté de trouver les bons hyperparamètres sans LoRA.
Motif de la recommandation :L'article détaille l'intégration de DDPO dans la bibliothèque TRL et fournit les hyperparamètres recommandés pour le fine-tuning de Stable Diffusion.
Motif de la recommandation :Mistral 7B est publié sous licence Apache 2.0 avec des comparaisons détaillées face à Llama 2 et des optimisations d'inférence, ce qui permet de juger du compromis coût-performance.
Motif de la recommandation :Décompose le principe, l'entraînement et les limites du 3D Gaussian Splatting, avec des repères concrets sur le VRAM et les visionneuses existantes.
Hugging Face présente Würstchen, un modèle de diffusion texte-image qui atteint une compression spatiale de 42x grâce à une architecture en trois étapes (VQGAN.
Motif de la recommandation :Le modèle atteint une compression spatiale 42x et un coût d'entraînement réduit, avec une intégration Diffusers directement réutilisable.
L'équipe Diffusers et les auteurs de T2I-Adapter ont collaboré pour intégrer le support des T2I-Adapters pour Stable Diffusion XL (SDXL) dans diffusers. T2I-Adapter-SDXL ne pèse que 79 M de paramètres (158 Mo en fp16), soit une réduction de 93,69 % par rapport à ControlNet-SDXL (1251 M, 2,5 Go), et n'est exécuté qu'une seule fois pendant tout le processus de débruitage. Les points de contrôle entraînés sur 3M d'images LAION-Aesthetics V2 sont disponibles pour les conditions sketch, canny, lineart, depth et openpose, avec un script d'entraînement et un exemple d'utilisation via StableDiffusionXLAdapterPipeline.
Motif de la recommandation :L'article détaille l'entraînement et l'usage des T2I-Adapters pour SDXL, avec des scripts et des points de contrôle ouverts, permettant de reproduire et de contrôler la génération d'images.
Motif de la recommandation :Falcon 180B est le plus grand modèle ouvert à sa sortie, avec 180B paramètres et 3,5T tokens d'entraînement, ce qui permet de situer les capacités des modèles ouverts face aux modèles propriétaires.
Motif de la recommandation :L'intégration d'AutoGPTQ dans Transformers permet de quantifier et exécuter des LLM en 4, 3 ou 2 bits avec une perte de précision négligeable et une latence proche du fp16.
Motif de la recommandation :Hugging Face détaille une solution d'assistant code auto-hébergée pour l'entreprise, avec les contraintes de conformité et le choix des modèles open source.
Motif de la recommandation :Présente les outils et le guide de conversion Core ML pour exécuter Llama 2 sur Mac, avec les limites de performances et les optimisations prévues.