Les N détails d'implémentation du RLHF avec PPO
The N Implementation Details of RLHF with PPO
Hugging Face publie une reproduction du codebase RLHF original d'OpenAI (openai/lm-human-preferences) et détaille les détails d'implémentation nécessaires pour reproduire ses courbes d'apprentissage sur des tâches stylistiques. Le codebase de reproduction (https://github.com/vwxyzjn/lm-human-preference-details) atteint des courbes quasi identiques à celles d'OpenAI, avec un espace de démonstration et les logs d'entraînement disponibles. L'article identifie une différence entre l'optimiseur Adam de PyTorch et celui de TensorFlow : PyTorch utilise un terme de normalisation plus petit en début d'entraînement, ce qui provoque des mises à jour de gradient plus agressives et affecte davantage les grands modèles comme gpt2-xl.
Source :Hugging Face Blog · huggingface.co