Fine-tuner Stable Diffusion avec DDPO via TRL
Finetune Stable Diffusion Models with DDPO via TRL
Le blog Hugging Face présente DDPOTrainer, un nouvel outil de la bibliothèque TRL permettant de fine-tuner des modèles de diffusion comme Stable Diffusion par apprentissage par renforcement. DDPO modélise le processus de débruitage comme un processus de décision markovien et utilise PPO pour optimiser une fonction de récompense, par exemple un prédicteur esthétique entraîné sur le jeu de données AVA. L'article détaille l'installation (pip install trl[diffusers]), le script d'exemple ddpo.py, les hyperparamètres recommandés pour un entraînement sur GPU unique (200 époques, train_batch_size 3, learning rate 3e-4) et les limites actuelles, notamment la restriction aux modèles SD vanilla et la difficulté de trouver les bons hyperparamètres sans LoRA.
L'article détaille l'intégration de DDPO dans la bibliothèque TRL et fournit les hyperparamètres recommandés pour le fine-tuning de Stable Diffusion.
Source :Hugging Face Blog · huggingface.co