Aller au contenu

Orientations techniques

Données et entraînement Dernières actualités

Les dessous de l'entraînement : construction de jeux de données, données synthétiques, méthodes de pré-entraînement et de post-entraînement, puissance de calcul et coûts d'entraînement.

84 sélections30 derniers jours 8 entréesTotal : 253 entrées

mise à jour

Archives de la sélection · page 4

11 juilletjeu.61–80 entrées
  1. Hugging Face Blog67

    Comment NuminaMath a remporté le 1er AIMO Progress Prize

    Numina et Hugging Face ont remporté le 1er Progress Prize de l'AI Math Olympiad (AIMO) avec NuminaMath 7B TIR.

    Motif de la recommandation :L'article détaille la recette d'entraînement en deux étapes et l'algorithme SC-TIR qui ont permis de résoudre 29 problèmes sur 50, une méthode transférable pour le fine-tuning d'un modèle de raisonnement mathématique.

5 juinmer.
20 marsmer.
  1. Hugging Face Blog62

    Cosmopedia : comment créer des données synthétiques à grande échelle pour le pré-entraînement des LLM

    Hugging Face présente Cosmopedia, un jeu de données synthétiques de plus de 30 millions de fichiers et 25 milliards de tokens généré par Mixtral-8x7B-Instruct-v0.1.

    Motif de la recommandation :L'article détaille la construction d'un jeu de données synthétiques de 25 milliards de tokens, avec la méthode de génération des prompts et la pile technique, utile pour ceux qui veulent reproduire ce type de données.

  2. Hugging Face Blog62

    GaLore : entraîner de grands modèles sur du matériel grand public

    Le blog Hugging Face présente GaLore, une méthode qui projette les gradients dans un sous-espace de bas rang pour réduire la mémoire des états d'optimiseur de plus de 82.

    Motif de la recommandation :L'article détaille la réduction de plus de 82,5 % de la mémoire des états d'optimiseur et fournit un exemple exécutable avec transformers, utile pour l'entraînement sur GPU grand public.

16 févrierven.
  1. Hugging Face Blog73

    Hugging Face : générer des données synthétiques avec un LLM open source pour entraîner un modèle spécialisé

    Hugging Face détaille une méthode pour créer des données synthétiques avec le LLM open source Mixtral-8x7B-Instruct-v0.1 afin d'entraîner un petit modèle spécialisé.

    Motif de la recommandation :Un cas concret de distillation par données synthétiques avec coûts, latence et émissions comparés à GPT-4, et des notebooks réutilisables.

1 févrierjeu.
  1. Hugging Face Blog65

    Constitutional AI avec des LLM ouverts : recette complète de Hugging Face

    Hugging Face publie une recette de bout en bout pour appliquer le Constitutional AI (CAI) aux modèles ouverts.

    Motif de la recommandation :L'article fournit une recette complète d'alignement Constitutional AI avec des modèles ouverts, incluant datasets, modèles et outil de génération à grande échelle.

2 janviermar.
3 octobremar.
13 septembremer.
1 aoûtmar.
12 juinlun.
  1. Hugging Face Blog62

    Les modèles de fondation peuvent-ils annoter des données comme des humains ?

    Hugging Face étend l'Open LLM Leaderboard avec des annotations humaines et des évaluations GPT-4 sur un jeu de test aveugle de 327 prompts.

    Motif de la recommandation :L'étude compare les annotations humaines et GPT-4 sur un même jeu de prompts et quantifie le biais positionnel ainsi que les écarts de corrélation par catégorie de tâche.

9 maimar.
  1. Hugging Face Blog60

    Créer un assistant de codage avec StarCoder : fine-tuning de StarChat

    Hugging Face détaille comment fine-tuner StarCoder, un modèle de 16B paramètres entraîné sur 80+ langages de programmation.

    Motif de la recommandation :L'article détaille le fine-tuning de StarCoder avec ChatML et DeepSpeed ZeRO-3, une méthode transférable pour transformer un modèle de code en assistant conversationnel.

24 marsven.
6 marslun.
  1. Hugging Face Blog65

    Kakao Brain publie les modèles ViT et ALIGN et le jeu de données COYO

    Kakao Brain et Hugging Face publient le jeu de données image-texte open source COYO de 700 millions de paires et deux modèles de vision-langage entraînés dessus.

    Motif de la recommandation :Kakao Brain ouvre le jeu de données COYO et les modèles ViT et ALIGN, permettant aux chercheurs de reproduire l'entraînement multimodal avec accès aux données.

3 marsven.
  1. Hugging Face Blog60

    Utiliser le machine learning pour aider les survivants du séisme en Turquie

    Après les séismes de magnitude 7,7 et 7,6 survenus le 6 février 2023 dans le sud-est de la Turquie.

    Motif de la recommandation :L'auteur détaille la chaîne complète OCR, NER et classification d'intentions déployée après le séisme en Turquie, une méthode réutilisable pour des applications d'urgence.

26 janvierjeu.
7 novembrelun.
  1. Hugging Face Blog67

    Entraîner Stable Diffusion avec Dreambooth via Diffusers

    Hugging Face détaille comment entraîner Stable Diffusion avec la technique Dreambooth via le script de Diffusers.

    Motif de la recommandation :L'article partage des réglages testés pour entraîner Stable Diffusion avec Dreambooth, notamment learning rate, étapes et prior preservation, ce qui aide à éviter le surapprentissage.

3 novembrejeu.
19 octobremer.
  1. Hugging Face Blog60

    MTEB : un benchmark massif pour les modèles d'embedding de texte

    Hugging Face présente MTEB, un benchmark massif destiné à mesurer les performances des modèles d'embedding de texte sur des tâches variées. Il regroupe 56 jeux de données répartis en 8 tâches, jusqu'à 112 langues, et un classement public de plus de 2000 résultats. La bibliothèque MTEB permet d'évaluer n'importe quel modèle produisant des embeddings et de soumettre ses résultats au classement.

    Motif de la recommandation :Le MTEB couvre 56 jeux de données et 8 tâches, avec un classement public et une bibliothèque réutilisable pour évaluer les modèles d'embedding.

26 septembrelun.
  1. Hugging Face Blog62

    SetFit : un apprentissage efficace en few-shot sans prompts

    Hugging Face, avec Intel Labs et le UKP Lab, présente SetFit, un framework d'apprentissage en few-shot pour les Sentence Transformers. Sur le jeu de données CR.

    Motif de la recommandation :L'article présente la méthode d'entraînement en deux étapes de SetFit et les résultats comparatifs sur RAFT, permettant de comprendre pourquoi un petit modèle peut atteindre les performances de T-Few.