Hugging Face publie TRL v1.0, bibliothèque de post-entraînement couvrant plus de 75 méthodes
TRL v1.0: Post-Training Library Built to Move with the Field
Hugging Face a publié TRL v1.0, une bibliothèque de post-entraînement qui passe d'une base de code de recherche à une bibliothèque stable avec un contrat de versioning sémantique. Elle implémente plus de 75 méthodes de post-entraînement et adopte une structure où le noyau stable (SFT, DPO, Reward modeling, RLOO, GRPO) et la couche expérimentale (ORPO, etc.) coexistent avec des contrats distincts. La bibliothèque est téléchargée 3 millions de fois par mois et sert d'infrastructure à des projets comme Unsloth et Axolotl. Les prochaines étapes incluent un GRPO asynchrone, la stabilisation de KTO et de formateurs de distillation, ainsi que des avertissements structurés pour rendre l'entraînement lisible par les agents.
L'article détaille la conception de stabilité de TRL v1.0 et sa couverture de plus de 75 méthodes de post-entraînement, utile pour comprendre l'évolution des bibliothèques d'entraînement.
Source :Hugging Face Blog · huggingface.co