Aller au contenu

Orientations techniques

Génération d'images Dernières actualités

Le front de la génération d'images : toute l'actualité de l'itération des modèles texte-image, des capacités d'édition d'image et de l'écosystème des outils de création.

45 sélections30 derniers jours 2 entréesTotal : 81 entrées

mise à jour

Archives de la sélection · page 2

22 octobremar.21–40 entrées
17 septembremar.
30 juilletmar.
  1. Hugging Face Blog60

    Comment réduire la mémoire des Diffusion Transformers avec Quanto et Diffusers

    Hugging Face présente comment quantifier les pipelines de diffusion basés sur Transformer avec les utilitaires Quanto de la bibliothèque Diffusers.

    Motif de la recommandation :L'article détaille les gains de mémoire mesurés sur trois pipelines de diffusion Transformer avec Quanto, avec des tableaux de latence et de qualité.

12 juinmer.
  1. Hugging Face Blog78

    Diffusers accueille Stable Diffusion 3 Medium avec optimisations mémoire et scripts LoRA

    Stable Diffusion 3 Medium (2B paramètres) de Stability AI est disponible sur le Hugging Face Hub et utilisable avec Diffusers. Le modèle repose sur une architecture MMDiT avec trois encodeurs de texte (CLIP L/14, OpenCLIP bigG/14, T5-v1.1-XXL) et un autoencodeur 16 canaux, entraîné avec un objectif de rectified flow matching. L'intégration Diffusers inclut des optimisations mémoire (offloading CPU, suppression de l'encodeur T5, quantification 8 bits via bitsandbytes) permettant de réduire la consommation de 18,7 Go à 4,3 Go, ainsi que des scripts de fine-tuning DreamBooth et LoRA.

    Motif de la recommandation :Le billet détaille l'intégration de SD3 Medium dans Diffusers, avec optimisations mémoire et scripts de fine-tuning LoRA directement réutilisables.

3 févriersam.
  1. Hugging Face Blog62

    SegMoE : un framework pour créer des modèles de diffusion Mixture-of-Experts

    SegMoE est un framework permettant de créer des modèles de diffusion Mixture-of-Experts à partir de modèles pré-entraînés.

    Motif de la recommandation :SegMoE permet de créer des modèles de diffusion Mixture-of-Experts à partir de modèles pré-entraînés, avec un package et une intégration diffusers directement réutilisables.

14 janvierdim.
  1. Hugging Face Blog62

    Exécuter gratuitement des workflows ComfyUI avec Gradio sur Hugging Face Spaces

    Hugging Face publie un tutoriel pas à pas pour convertir un workflow ComfyUI en application Gradio et la déployer gratuitement sur Hugging Face Spaces via ZeroGPU. Le processus passe par l'extension ComfyUI-to-Python-Extension pour exporter le workflow en script Python, puis par la création d'une interface Gradio exposant prompt, image de structure, image de style et forces associées. Les modèles sont téléchargés depuis le Hub via hf_hub_download et préchargés hors de la fonction décorée par @spaces.GPU pour tirer parti du serverless. L'auteur indique qu'une automatisation complète du processus est prévue début 2025.

    Motif de la recommandation :Un guide pas à pas pour transformer un workflow ComfyUI en application Gradio et l'héberger gratuitement sur ZeroGPU.

4 janvierjeu.
  1. Hugging Face Blog62

    Hugging Face publie aMUSEd, un modèle de génération d'images texte-image non-diffusion

    Hugging Face a publié aMUSEd, un modèle de génération d'images texte-image efficace non-diffusion.

    Motif de la recommandation :aMUSEd adopte une méthode non-diffusion MIM, avec un poids d'environ 800M et une inférence rapide, et fournit un code d'entraînement et de fine-tuning, ce qui permet de comprendre la voie de génération d'images sans diffusion.

2 janviermar.
9 novembrejeu.
29 septembreven.
  1. Hugging Face Blog62

    Fine-tuner Stable Diffusion avec DDPO via TRL

    Le blog Hugging Face présente DDPOTrainer, un nouvel outil de la bibliothèque TRL permettant de fine-tuner des modèles de diffusion comme Stable Diffusion par apprentissage par renforcement. DDPO modélise le processus de débruitage comme un processus de décision markovien et utilise PPO pour optimiser une fonction de récompense, par exemple un prédicteur esthétique entraîné sur le jeu de données AVA. L'article détaille l'installation (pip install trl[diffusers]), le script d'exemple ddpo.py, les hyperparamètres recommandés pour un entraînement sur GPU unique (200 époques, train_batch_size 3, learning rate 3e-4) et les limites actuelles, notamment la restriction aux modèles SD vanilla et la difficulté de trouver les bons hyperparamètres sans LoRA.

    Motif de la recommandation :L'article détaille l'intégration de DDPO dans la bibliothèque TRL et fournit les hyperparamètres recommandés pour le fine-tuning de Stable Diffusion.

18 septembrelun.
  1. Hugging Face Blog62

    Introduction au 3D Gaussian Splatting : principe, entraînement et perspectives graphiques

    Le 3D Gaussian Splatting est une technique de rastérisation décrite dans l'article 3D Gaussian Splatting for Real-Time Radiance Field Rendering.

    Motif de la recommandation :Décompose le principe, l'entraînement et les limites du 3D Gaussian Splatting, avec des repères concrets sur le VRAM et les visionneuses existantes.

13 septembremer.
  1. Hugging Face Blog72

    Würstchen : un modèle de diffusion rapide pour la génération d'images

    Hugging Face présente Würstchen, un modèle de diffusion texte-image qui atteint une compression spatiale de 42x grâce à une architecture en trois étapes (VQGAN.

    Motif de la recommandation :Le modèle atteint une compression spatiale 42x et un coût d'entraînement réduit, avec une intégration Diffusers directement réutilisable.

8 septembreven.
  1. Hugging Face Blog62

    Génération contrôlable efficace pour SDXL avec T2I-Adapters

    L'équipe Diffusers et les auteurs de T2I-Adapter ont collaboré pour intégrer le support des T2I-Adapters pour Stable Diffusion XL (SDXL) dans diffusers. T2I-Adapter-SDXL ne pèse que 79 M de paramètres (158 Mo en fp16), soit une réduction de 93,69 % par rapport à ControlNet-SDXL (1251 M, 2,5 Go), et n'est exécuté qu'une seule fois pendant tout le processus de débruitage. Les points de contrôle entraînés sur 3M d'images LAION-Aesthetics V2 sont disponibles pour les conditions sketch, canny, lineart, depth et openpose, avec un script d'entraînement et un exemple d'utilisation via StableDiffusionXLAdapterPipeline.

    Motif de la recommandation :L'article détaille l'entraînement et l'usage des T2I-Adapters pour SDXL, avec des scripts et des points de contrôle ouverts, permettant de reproduire et de contrôler la génération d'images.

1 aoûtmar.
27 juilletjeu.
  1. Hugging Face Blog62

    Stable Diffusion XL sur Mac avec quantification Core ML avancée

    Hugging Face et Apple publient des modèles Core ML de Stable Diffusion XL, dont une version avec quantification mixed-bit réduisant l'UNet de 4.

    Motif de la recommandation :Présente la quantification mixed-bit et des recettes prêtes à l'emploi pour exécuter Stable Diffusion XL sur Mac, avec des chiffres de taille et de latence.

15 juinjeu.
  1. Hugging Face Blog62

    Comment accélérer Stable Diffusion sur iPhone, iPad et Mac avec Core ML

    Hugging Face présente les optimisations Core ML de WWDC'23 pour exécuter Stable Diffusion plus rapidement et avec moins de mémoire sur iPhone.

    Motif de la recommandation :L'article détaille la quantification 6 bits de Core ML et fournit les commandes de conversion, permettant de reproduire le déploiement de Stable Diffusion sur appareil.

26 avrilmer.
  1. Hugging Face Blog62

    Exécuter le modèle de génération d'images IF avec diffusers sur un Google Colab gratuit

    Le blog Hugging Face explique comment exécuter le modèle open source de génération d'images texte-image IF de DeepFloyd sur un Google Colab gratuit avec la bibliothèque diffusers. IF fonctionne directement dans l'espace pixel et utilise T5-XXL comme encodeur de texte, ce qui lui permet de générer des détails haute fréquence comme les visages et les mains ainsi que du texte dans les images, mais ses composants totalisent plus de 10 milliards de paramètres, avec T5-XXL à 20 Go et le UNet de l'étape 1 à 17,2 Go en float32. Le tutoriel montre comment charger T5 en quantification 8 bits via bitsandbytes, charger modulairement chaque composant avec device_map, libérer la mémoire GPU entre les étapes, et enchaîner les trois étapes de génération, de variation d'image et d'inpainting. L'auteur précise que cette configuration échange de la vitesse contre de la mémoire et n'est pas recommandée en production, où un A100 de 40 Go est préférable.

    Motif de la recommandation :Détaille comment exécuter le modèle de génération d'images IF sur un Colab gratuit via quantification 8 bits et chargement modulaire, avec des étapes directement réutilisables.

24 marsven.
3 marsven.
26 janvierjeu.