Fine-tuner Llama 2 avec DPO dans la bibliothèque TRL
Fine-tune Llama 2 with DPO
Hugging Face présente l'implémentation de la méthode Direct Preference Optimization (DPO) dans la bibliothèque TRL et montre comment fine-tuner le modèle Llama 2 7B sur le jeu de données de préférences Stack Exchange. DPO remplace l'étape de modélisation de récompense et l'optimisation RL de RLHF par un objectif de vraisemblance directe optimisé via une simple perte d'entropie croisée binaire, en s'appuyant sur une correspondance analytique entre la fonction de récompense et la politique RL optimale. Le tutoriel détaille le pipeline complet : SFT avec QLoRA sur Llama 2 7B, préparation des données de préférence au format prompt/chosen/rejected, puis entraînement avec DPOTrainer en configurant le paramètre beta (0,1 à 0,5). Le code source des scripts d'entraînement est disponible dans le répertoire examples/stack_llama_2 et le modèle entraîné est publié sur le Hub Hugging Face.
Le tutoriel détaille l'implémentation de DPO dans TRL et le fine-tuning de Llama 2, avec le code et les métriques de suivi.
Source :Hugging Face Blog · huggingface.co