Aller au contenu
Hugging Face Blog·· 2024-03-20sélectionAI Score62

Cosmopedia : comment créer des données synthétiques à grande échelle pour le pré-entraînement des LLM

Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models

AI Introduction

Hugging Face présente Cosmopedia, un jeu de données synthétiques de plus de 30 millions de fichiers et 25 milliards de tokens généré par Mixtral-8x7B-Instruct-v0.1.

Raison de la recommandation

L'article détaille la construction d'un jeu de données synthétiques de 25 milliards de tokens, avec la méthode de génération des prompts et la pile technique, utile pour ceux qui veulent reproduire ce type de données.

Source :Hugging Face Blog · huggingface.co