StarCoder2-15B-Instruct : un modèle de code auto-aligné entièrement transparent et permissif
StarCoder2-Instruct: Fully Transparent and Permissive Self-Alignment for Code Generation
Hugging Face publie StarCoder2-15B-Instruct-v0.1, présenté comme le premier LLM de code entièrement auto-aligné entraîné via un pipeline transparent et permissif. Le modèle génère lui-même des paires instruction-réponse à partir de StarCoder2-15B, sans annotation humaine ni distillation de LLM propriétaires, et atteint 72,6 sur HumanEval, surpassant les 72,0 de CodeLlama-70B-Instruct. Sur LiveCodeBench, il devance même la version du même modèle entraînée sur des données distillées de GPT-4, ce qui suggère qu'un LLM apprend plus efficacement sur sa propre distribution. Les datasets et l'intégralité du pipeline sont open source.
Le pipeline entièrement ouvert et l'auto-alignement sans données distillées de GPT-4 permettent de reproduire et d'adapter la méthode à d'autres modèles de code.
Source :Hugging Face Blog · huggingface.co