Aller au contenu

Formes de contenu

Tutoriels pratiques Dernières actualités

Du contenu pratique directement utilisable : astuces de prompting, mise en place de workflows, usage des outils et retours d'expérience sur les pièges.

58 sélections30 derniers jours 5 entréesTotal : 268 entrées

mise à jour

Archives de la sélection · page 2

28 janviermer.21–40 entrées
5 janvierlun.
25 avrilven.
31 janvierven.
30 juilletmar.
  1. Hugging Face Blog60

    Comment réduire la mémoire des Diffusion Transformers avec Quanto et Diffusers

    Hugging Face présente comment quantifier les pipelines de diffusion basés sur Transformer avec les utilitaires Quanto de la bibliothèque Diffusers.

    Motif de la recommandation :L'article détaille les gains de mémoire mesurés sur trois pipelines de diffusion Transformer avec Quanto, avec des tableaux de latence et de qualité.

20 marsmer.
  1. Hugging Face Blog62

    GaLore : entraîner de grands modèles sur du matériel grand public

    Le blog Hugging Face présente GaLore, une méthode qui projette les gradients dans un sous-espace de bas rang pour réduire la mémoire des états d'optimiseur de plus de 82.

    Motif de la recommandation :L'article détaille la réduction de plus de 82,5 % de la mémoire des états d'optimiseur et fournit un exemple exécutable avec transformers, utile pour l'entraînement sur GPU grand public.

16 févrierven.
  1. Hugging Face Blog73

    Hugging Face : générer des données synthétiques avec un LLM open source pour entraîner un modèle spécialisé

    Hugging Face détaille une méthode pour créer des données synthétiques avec le LLM open source Mixtral-8x7B-Instruct-v0.1 afin d'entraîner un petit modèle spécialisé.

    Motif de la recommandation :Un cas concret de distillation par données synthétiques avec coûts, latence et émissions comparés à GPT-4, et des notebooks réutilisables.

24 janviermer.
14 janvierdim.
  1. Hugging Face Blog62

    Exécuter gratuitement des workflows ComfyUI avec Gradio sur Hugging Face Spaces

    Hugging Face publie un tutoriel pas à pas pour convertir un workflow ComfyUI en application Gradio et la déployer gratuitement sur Hugging Face Spaces via ZeroGPU. Le processus passe par l'extension ComfyUI-to-Python-Extension pour exporter le workflow en script Python, puis par la création d'une interface Gradio exposant prompt, image de structure, image de style et forces associées. Les modèles sont téléchargés depuis le Hub via hf_hub_download et préchargés hors de la fonction décorée par @spaces.GPU pour tirer parti du serverless. L'auteur indique qu'une automatisation complète du processus est prévue début 2025.

    Motif de la recommandation :Un guide pas à pas pour transformer un workflow ComfyUI en application Gradio et l'héberger gratuitement sur ZeroGPU.

10 janviermer.
  1. Hugging Face Blog62

    Unsloth et TRL : fine-tuning LLM 2x plus rapide

    Unsloth, une bibliothèque légère développée par la communauté, accélère le fine-tuning des LLM jusqu'à 2x et réduit l'usage de mémoire jusqu'à 74% sans dégradation de précision.

    Motif de la recommandation :L'article détaille les gains de vitesse et de mémoire d'Unsloth pour le fine-tuning, avec des benchmarks reproductibles et un exemple d'intégration à TRL.

2 janviermar.
20 décembremer.
  1. Hugging Face Blog60

    Décodage spéculatif pour une inférence Whisper 2x plus rapide

    Le blog Hugging Face montre comment le décodage spéculatif, implémenté comme stratégie « assisted generation » dans Transformers.

    Motif de la recommandation :L'article détaille l'implémentation du décodage spéculatif dans Transformers avec des benchmarks reproductibles, permettant de réduire de moitié le temps d'inférence de Whisper sans perte de précision.

11 décembrelun.
  1. Hugging Face Blog60

    Mixture of Experts expliqué : briques, entraînement et compromis de service

    Hugging Face publie une explication des Mixture of Experts (MoE), architecture mise en avant par la sortie de Mixtral 8x7B. L'article décrit les deux composants d'une couche MoE.

    Motif de la recommandation :L'article détaille les briques, l'entraînement et les compromis de service des MoE, utile pour comprendre l'architecture derrière Mixtral 8x7B.

27 octobreven.
  1. Hugging Face Blog62

    Personal Copilot : entraîner son propre assistant de codage avec StarCoder

    Hugging Face présente HugCoder, un LLM de code fine-tuné sur les dépôts publics de l'organisation Hugging Face.

    Motif de la recommandation :L'article détaille le workflow complet de collecte de données, de fine-tuning QLoRA et de déploiement local d'un copilote de code, avec des scripts et des configurations réutilisables.

29 septembreven.
  1. Hugging Face Blog62

    Fine-tuner Stable Diffusion avec DDPO via TRL

    Le blog Hugging Face présente DDPOTrainer, un nouvel outil de la bibliothèque TRL permettant de fine-tuner des modèles de diffusion comme Stable Diffusion par apprentissage par renforcement. DDPO modélise le processus de débruitage comme un processus de décision markovien et utilise PPO pour optimiser une fonction de récompense, par exemple un prédicteur esthétique entraîné sur le jeu de données AVA. L'article détaille l'installation (pip install trl[diffusers]), le script d'exemple ddpo.py, les hyperparamètres recommandés pour un entraînement sur GPU unique (200 époques, train_batch_size 3, learning rate 3e-4) et les limites actuelles, notamment la restriction aux modèles SD vanilla et la difficulté de trouver les bons hyperparamètres sans LoRA.

    Motif de la recommandation :L'article détaille l'intégration de DDPO dans la bibliothèque TRL et fournit les hyperparamètres recommandés pour le fine-tuning de Stable Diffusion.

18 septembrelun.
  1. Hugging Face Blog62

    Introduction au 3D Gaussian Splatting : principe, entraînement et perspectives graphiques

    Le 3D Gaussian Splatting est une technique de rastérisation décrite dans l'article 3D Gaussian Splatting for Real-Time Radiance Field Rendering.

    Motif de la recommandation :Décompose le principe, l'entraînement et les limites du 3D Gaussian Splatting, avec des repères concrets sur le VRAM et les visionneuses existantes.

13 septembremer.
8 aoûtmar.
  1. Hugging Face Blog62

    Fine-tuner Llama 2 avec DPO dans la bibliothèque TRL

    Hugging Face présente l'implémentation de la méthode Direct Preference Optimization (DPO) dans la bibliothèque TRL et montre comment fine-tuner le modèle Llama 2 7B sur le jeu de données de préférences Stack Exchange. DPO remplace l'étape de modélisation de récompense et l'optimisation RL de RLHF par un objectif de vraisemblance directe optimisé via une simple perte d'entropie croisée binaire, en s'appuyant sur une correspondance analytique entre la fonction de récompense et la politique RL optimale. Le tutoriel détaille le pipeline complet : SFT avec QLoRA sur Llama 2 7B, préparation des données de préférence au format prompt/chosen/rejected, puis entraînement avec DPOTrainer en configurant le paramètre beta (0,1 à 0,5). Le code source des scripts d'entraînement est disponible dans le répertoire examples/stack_llama_2 et le modèle entraîné est publié sur le Hub Hugging Face.

    Motif de la recommandation :Le tutoriel détaille l'implémentation de DPO dans TRL et le fine-tuning de Llama 2, avec le code et les métriques de suivi.

11 maijeu.
  1. Hugging Face Blog62

    Hugging Face présente la génération assistée pour réduire la latence de génération de texte

    Hugging Face présente la génération assistée, une méthode de décodage qui utilise un petit modèle assistant pour proposer des tokens candidats.

    Motif de la recommandation :L'article détaille le goulot d'étranglement mémoire de la génération autoregressive et propose une méthode de décodage assisté avec des gains de latence mesurés.

9 maimar.