Aller au contenu
6mois13jourjeudi
6mois5jourmercredi
5mois28jourmardi
4mois19jourvendredi
4mois4jourjeudi
3mois20jourmercredi
  1. Hugging Face Blog62

    Cosmopedia : comment créer des données synthétiques à grande échelle pour le pré-entraînement des LLM

    Hugging Face présente Cosmopedia, un jeu de données synthétiques de plus de 30 millions de fichiers et 25 milliards de tokens généré par Mixtral-8x7B-Instruct-v0.1。

    Motif de la recommandation :L'article détaille la construction d'un jeu de données synthétiques de 25 milliards de tokens, avec la méthode de génération des prompts et la pile technique, utile pour ceux qui veulent reproduire ce type de données.

  2. Hugging Face Blog62

    GaLore : entraîner de grands modèles sur du matériel grand public

    Le blog Hugging Face présente GaLore, une méthode qui projette les gradients dans un sous-espace de bas rang pour réduire la mémoire des états d'optimiseur de plus de 82。

    Motif de la recommandation :L'article détaille la réduction de plus de 82,5 % de la mémoire des états d'optimiseur et fournit un exemple exécutable avec transformers, utile pour l'entraînement sur GPU grand public.

3mois18jourlundi
3mois15jourvendredi
  1. Hugging Face Blog55

    Hugging Face publie le dataset WebSight et le modèle Sightseer pour convertir les captures d'écran web en code HTML

    Hugging Face présente WebSight, un dataset synthétique de paires capture d'écran et code HTML destiné à entraîner des systèmes d'IA capables de transformer des maquettes web en code HTML fonctionnel. Après la version v0.1 de janvier 2024 contenant 823 000 paires, la mise à jour v0.2 introduit des images réelles dans les captures d'écran, passe à Tailwind CSS et porte le dataset à 2 millions d'exemples. En s'appuyant sur WebSight, Hugging Face a fine-tuné son futur modèle de fondation vision-langage pour obtenir Sightseer, capable de convertir des captures d'écran de pages web en HTML fonctionnel et d'y intégrer des images proches de celles de l'original. Le dataset, le rapport technique et un notebook Colab sont disponibles en open source.

3mois4jourlundi
2mois26jourlundi
2mois23jourvendredi
2mois19jourlundi
2mois16jourvendredi
  1. Hugging Face Blog73

    Hugging Face : générer des données synthétiques avec un LLM open source pour entraîner un modèle spécialisé

    Hugging Face détaille une méthode pour créer des données synthétiques avec le LLM open source Mixtral-8x7B-Instruct-v0.1 afin d'entraîner un petit modèle spécialisé。

    Motif de la recommandation :Un cas concret de distillation par données synthétiques avec coûts, latence et émissions comparés à GPT-4, et des notebooks réutilisables.

2mois2jourvendredi
2mois1jourjeudi
  1. Hugging Face Blog65

    Constitutional AI avec des LLM ouverts : recette complète de Hugging Face

    Hugging Face publie une recette de bout en bout pour appliquer le Constitutional AI (CAI) aux modèles ouverts。

    Motif de la recommandation :L'article fournit une recette complète d'alignement Constitutional AI avec des modèles ouverts, incluant datasets, modèles et outil de génération à grande échelle.

1mois31jourmercredi
1mois19jourvendredi
1mois18jourjeudi
1mois2jourmardi
12mois18jourlundi
12mois6jourmercredi
12mois1jourvendredi
  1. Hugging Face Blog52

    Open LLM Leaderboard retire le benchmark DROP après avoir identifié des erreurs de notation

    Hugging Face a retiré le benchmark DROP de l'Open LLM Leaderboard après avoir constaté que la majorité des modèles obtenaient un f1-score inférieur à 10 sur 100. L'enquête a révélé que la normalisation ignorait les réponses numériques suivies d'un espace autre qu'un espace simple, et que l'utilisation du point comme token d'arrêt interrompait les réponses à virgule flottante et pénalisait les modèles générant de longues réponses. Une réexécution complète coûtant 8 années de temps GPU, l'équipe a décidé de retirer DROP jusqu'à ce qu'une nouvelle version corrige le scoring et la normalisation.

11mois7jourmardi
10mois25jourmercredi
10mois3jourmardi
9mois18jourlundi
9mois13jourmercredi
8mois2jourmercredi
  1. Hugging Face Blog22

    Huggy Lingo : Hugging Face utilise le machine learning pour améliorer les métadonnées linguistiques du Hub

    Hugging Face déploie Huggy Lingo, un système qui détecte automatiquement la langue des datasets du Hub dépourvus de métadonnées linguistiques et ouvre des pull requests via librarian-bots pour les ajouter. Le modèle fastText de Meta (facebook/fasttext-language-identification), issu des travaux No Language Left Behind, identifie 217 langues à partir de 20 lignes de texte récupérées via l'API dataset viewer. Environ 87 % des quelque 50 000 datasets publics ne précisent pas leur langue, contre 13 % qui le font, l'anglais représentant à lui seul près de 19 % des tags déclarés.

8mois1jourmardi
7mois14jourvendredi
6mois29jourjeudi
6mois19jourlundi
6mois12jourlundi
  1. Hugging Face Blog62

    Les modèles de fondation peuvent-ils annoter des données comme des humains ?

    Hugging Face étend l'Open LLM Leaderboard avec des annotations humaines et des évaluations GPT-4 sur un jeu de test aveugle de 327 prompts。

    Motif de la recommandation :L'étude compare les annotations humaines et GPT-4 sur un même jeu de prompts et quantifie le biais positionnel ainsi que les écarts de corrélation par catégorie de tâche.

6mois7jourmercredi
5mois23jourmardi
  1. Hugging Face Blog42

    Instruction-tuning de Stable Diffusion avec InstructPix2Pix

    Hugging Face explore le fine-tuning par instructions de Stable Diffusion en s'appuyant sur la méthode InstructPix2Pix pour suivre des instructions d'édition précises comme la cartoonisation ou le débruitage d'image. Le pipeline génère 50 phrases synonymes via ChatGPT pour l'instruction « Cartoonize the image », puis utilise 5000 échantillons d'Imagenette traités par un modèle Whitebox CartoonGAN pré-entraîné comme labels. Le code, les modèles pré-entraînés et les datasets sont publiés en open source.

5mois16jourmardi