Aller au contenu
24 octobremar.
  1. Hugging Face Blog52

    Les N détails d'implémentation du RLHF avec PPO

    Hugging Face publie une reproduction du codebase RLHF original d'OpenAI (openai/lm-human-preferences) et détaille les détails d'implémentation nécessaires pour reproduire ses courbes d'apprentissage sur des tâches stylistiques. Le codebase de reproduction (https://github.com/vwxyzjn/lm-human-preference-details) atteint des courbes quasi identiques à celles d'OpenAI, avec un espace de démonstration et les logs d'entraînement disponibles. L'article identifie une différence entre l'optimiseur Adam de PyTorch et celui de TensorFlow : PyTorch utilise un terme de normalisation plus petit en début d'entraînement, ce qui provoque des mises à jour de gradient plus agressives et affecte davantage les grands modèles comme gpt2-xl.

2 octobrelun.
29 septembreven.
  1. Hugging Face Blog62

    Fine-tuner Stable Diffusion avec DDPO via TRL

    Le blog Hugging Face présente DDPOTrainer, un nouvel outil de la bibliothèque TRL permettant de fine-tuner des modèles de diffusion comme Stable Diffusion par apprentissage par renforcement. DDPO modélise le processus de débruitage comme un processus de décision markovien et utilise PPO pour optimiser une fonction de récompense, par exemple un prédicteur esthétique entraîné sur le jeu de données AVA. L'article détaille l'installation (pip install trl[diffusers]), le script d'exemple ddpo.py, les hyperparamètres recommandés pour un entraînement sur GPU unique (200 époques, train_batch_size 3, learning rate 3e-4) et les limites actuelles, notamment la restriction aux modèles SD vanilla et la difficulté de trouver les bons hyperparamètres sans LoRA.

    Motif de la recommandation :L'article détaille l'intégration de DDPO dans la bibliothèque TRL et fournit les hyperparamètres recommandés pour le fine-tuning de Stable Diffusion.

28 septembrejeu.
18 septembrelun.
  1. Hugging Face Blog62

    Introduction au 3D Gaussian Splatting : principe, entraînement et perspectives graphiques

    Le 3D Gaussian Splatting est une technique de rastérisation décrite dans l'article 3D Gaussian Splatting for Real-Time Radiance Field Rendering.

    Motif de la recommandation :Décompose le principe, l'entraînement et les limites du 3D Gaussian Splatting, avec des repères concrets sur le VRAM et les visionneuses existantes.

15 septembreven.
13 septembremer.
12 septembremar.
30 aoûtmer.
9 aoûtmer.
8 aoûtmar.
  1. Hugging Face Blog62

    Fine-tuner Llama 2 avec DPO dans la bibliothèque TRL

    Hugging Face présente l'implémentation de la méthode Direct Preference Optimization (DPO) dans la bibliothèque TRL et montre comment fine-tuner le modèle Llama 2 7B sur le jeu de données de préférences Stack Exchange. DPO remplace l'étape de modélisation de récompense et l'optimisation RL de RLHF par un objectif de vraisemblance directe optimisé via une simple perte d'entropie croisée binaire, en s'appuyant sur une correspondance analytique entre la fonction de récompense et la politique RL optimale. Le tutoriel détaille le pipeline complet : SFT avec QLoRA sur Llama 2 7B, préparation des données de préférence au format prompt/chosen/rejected, puis entraînement avec DPOTrainer en configurant le paramètre beta (0,1 à 0,5). Le code source des scripts d'entraînement est disponible dans le répertoire examples/stack_llama_2 et le modèle entraîné est publié sur le Hub Hugging Face.

    Motif de la recommandation :Le tutoriel détaille l'implémentation de DPO dans TRL et le fine-tuning de Llama 2, avec le code et les métriques de suivi.

4 aoûtven.
2 aoûtmer.
1 aoûtmar.
17 juilletlun.
14 juilletven.
5 juilletmer.
4 juilletmar.
3 juilletlun.
  1. Hugging Face Blog22

    Créer un générateur d'applications web avec des modèles ML ouverts

    Hugging Face détaille un tutoriel pour construire un générateur d'applications web combinant Node.js et le modèle WizardCoder-15B servi via l'API Inference Endpoints. Le serveur Express diffuse en streaming le HTML généré token par token directement au navigateur, avec un prompt guidant le modèle vers TailwindCSS et une logique JS encapsulée. Une alternative gratuite via l'Inference API est proposée pour les modèles plus petits, tandis que les modèles performants nécessitent 32 Go de mémoire ou plus et une accélération matérielle pour une latence correcte.

29 juinjeu.
19 juinlun.
15 juinjeu.
12 juinlun.
25 maijeu.
16 maimar.
15 mailun.
11 maijeu.
  1. Hugging Face Blog62

    Hugging Face présente la génération assistée pour réduire la latence de génération de texte

    Hugging Face présente la génération assistée, une méthode de décodage qui utilise un petit modèle assistant pour proposer des tokens candidats.

    Motif de la recommandation :L'article détaille le goulot d'étranglement mémoire de la génération autoregressive et propose une méthode de décodage assisté avec des gains de latence mesurés.

9 maimar.
8 mailun.
1 mailun.
27 avriljeu.
26 avrilmer.
  1. Hugging Face Blog62

    Exécuter le modèle de génération d'images IF avec diffusers sur un Google Colab gratuit

    Le blog Hugging Face explique comment exécuter le modèle open source de génération d'images texte-image IF de DeepFloyd sur un Google Colab gratuit avec la bibliothèque diffusers. IF fonctionne directement dans l'espace pixel et utilise T5-XXL comme encodeur de texte, ce qui lui permet de générer des détails haute fréquence comme les visages et les mains ainsi que du texte dans les images, mais ses composants totalisent plus de 10 milliards de paramètres, avec T5-XXL à 20 Go et le UNet de l'étape 1 à 17,2 Go en float32. Le tutoriel montre comment charger T5 en quantification 8 bits via bitsandbytes, charger modulairement chaque composant avec device_map, libérer la mémoire GPU entre les étapes, et enchaîner les trois étapes de génération, de variation d'image et d'inpainting. L'auteur précise que cette configuration échange de la vitesse contre de la mémoire et n'est pas recommandée en production, où un A100 de 40 Go est préférable.

    Motif de la recommandation :Détaille comment exécuter le modèle de génération d'images IF sur un Colab gratuit via quantification 8 bits et chargement modulaire, avec des étapes directement réutilisables.

14 avrilven.
5 avrilmer.
28 marsmar.
27 marslun.