Hugging Face Blog·· 2024-03-20sélectionAI Score62
Cosmopedia : comment créer des données synthétiques à grande échelle pour le pré-entraînement des LLM
Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models
AI Introduction
Hugging Face présente Cosmopedia, un jeu de données synthétiques de plus de 30 millions de fichiers et 25 milliards de tokens généré par Mixtral-8x7B-Instruct-v0.1.
Raison de la recommandation
L'article détaille la construction d'un jeu de données synthétiques de 25 milliards de tokens, avec la méthode de génération des prompts et la pile technique, utile pour ceux qui veulent reproduire ce type de données.
Source :Hugging Face Blog · huggingface.co