Aller au contenu
Hugging Face Blog·· 2023-09-29sélectionAI Score62

Fine-tuner Stable Diffusion avec DDPO via TRL

Finetune Stable Diffusion Models with DDPO via TRL

AI Introduction

Le blog Hugging Face présente DDPOTrainer, un nouvel outil de la bibliothèque TRL permettant de fine-tuner des modèles de diffusion comme Stable Diffusion par apprentissage par renforcement. DDPO modélise le processus de débruitage comme un processus de décision markovien et utilise PPO pour optimiser une fonction de récompense, par exemple un prédicteur esthétique entraîné sur le jeu de données AVA. L'article détaille l'installation (pip install trl[diffusers]), le script d'exemple ddpo.py, les hyperparamètres recommandés pour un entraînement sur GPU unique (200 époques, train_batch_size 3, learning rate 3e-4) et les limites actuelles, notamment la restriction aux modèles SD vanilla et la difficulté de trouver les bons hyperparamètres sans LoRA.

Raison de la recommandation

L'article détaille l'intégration de DDPO dans la bibliothèque TRL et fournit les hyperparamètres recommandés pour le fine-tuning de Stable Diffusion.

Source :Hugging Face Blog · huggingface.co