Aller au contenu
3 novembrejeu.
19 octobremer.
  1. Hugging Face Blog60

    MTEB : un benchmark massif pour les modèles d'embedding de texte

    Hugging Face présente MTEB, un benchmark massif destiné à mesurer les performances des modèles d'embedding de texte sur des tâches variées. Il regroupe 56 jeux de données répartis en 8 tâches, jusqu'à 112 langues, et un classement public de plus de 2000 résultats. La bibliothèque MTEB permet d'évaluer n'importe quel modèle produisant des embeddings et de soumettre ses résultats au classement.

    Motif de la recommandation :Le MTEB couvre 56 jeux de données et 8 tâches, avec un classement public et une bibliothèque réutilisable pour évaluer les modèles d'embedding.

3 octobrelun.
26 septembrelun.
  1. Hugging Face Blog62

    SetFit : un apprentissage efficace en few-shot sans prompts

    Hugging Face, avec Intel Labs et le UKP Lab, présente SetFit, un framework d'apprentissage en few-shot pour les Sentence Transformers. Sur le jeu de données CR.

    Motif de la recommandation :L'article présente la méthode d'entraînement en deux étapes de SetFit et les résultats comparatifs sur RAFT, permettant de comprendre pourquoi un petit modèle peut atteindre les performances de T-Few.

22 aoûtlun.
10 aoûtmer.
16 juilletsam.
14 juilletjeu.
  1. Hugging Face Blog58

    La technologie derrière l'entraînement de BLOOM : 384 GPU A100 et Megatron-DeepSpeed

    L'équipe BigScience de Hugging Face détaille l'infrastructure matérielle et logicielle utilisée pour entraîner le modèle multilingue BLOOM de 176 milliards de paramètres. L'entraînement a mobilisé 384 GPU NVIDIA A100 80GB répartis sur 48 nœuds, avec une architecture GPT-3 enrichie, un jeu de données de 350 milliards de tokens couvrant 46 langues, et une durée d'environ 3,5 mois sur le supercalculateur Jean Zay. Le framework Megatron-DeepSpeed combine le parallélisme de données ZeRO, le parallélisme tensoriel de Megatron-LM et le parallélisme de pipeline pour répartir l'entraînement, tandis que le format BF16 et des kernels CUDA fusionnés ont permis de stabiliser et d'accélérer le processus.

29 juinmer.
  1. Hugging Face Blog17

    Liftoff! Comment démarrer votre premier projet ML 🚀

    Hugging Face publie un guide pour débutants qui utilise Sentence Transformers (ST) comme exemple pour passer de zéro à un premier projet ML autonome. ST transforme des phrases en embeddings vectoriels et fournit la fonction util.cos_sim pour calculer la similarité cosinus (score de -1 à 1), avec le modèle msmarco-MiniLM-L-6-v3 chargé dans un Jupyter notebook. La bibliothèque compte près de 8 000 étoiles sur GitHub et plus de 3 000 projets et packages qui en dépendent, et sert à la recherche sémantique, au clustering, à la distillation de modèles ou à CLIP.

14 juinmar.
23 mailun.
  1. Hugging Face Blog30

    TAPEX : pré-entraînement efficace de tables sans données réelles

    Microsoft présente TAPEX, une méthode de pré-entraînement de tables qui apprend un exécuteur SQL neuronal sur un corpus synthétique généré en échantillonnant des requêtes SQL exécutables et leurs résultats, sans recourir à des données réelles. Intégré à Transformers 4.19.0, TAPEX atteint de nouveaux résultats SOTA sur quatre benchmarks : 89,6 % sur WikiSQL (+2,3 %), 84,2 % sur TabFact (+3,2 %), 74,5 % sur SQA (+3,5 %) et 57,5 % sur WikiTableQuestions (+4,8 %).

13 maiven.
2 mailun.
28 avriljeu.
25 avrillun.
  1. Hugging Face Blog20

    Service client boosté par le machine learning avec l'écosystème Hugging Face

    Hugging Face montre comment automatiser le filtrage des messages clients mécontents en modélisant le problème comme une classification de texte à 5 classes (very unsatisfied à very satisfied). Le dataset Amazon reviews multi est retenu pour ses labels de sentiment de 1 à 5 étoiles, jugé plus adapté que GLUE, Amazon polarity ou Tweet eval. L'approche vise à répondre à 100 % des messages des clients les plus insatisfaits, supposés minoritaires parmi l'ensemble des retours.

22 avrilven.
  1. Hugging Face Blog22

    Hugging Face Hub : suivi et recherche des émissions de CO2 des modèles

    Hugging Face ajoute à sa bibliothèque huggingface_hub un paramètre emissions_threshold permettant de filtrer les modèles du Hub selon les émissions de CO2 générées lors de leur entraînement. L'intégration de codecarbon dans transformers enregistre automatiquement ces émissions via CodeCarbonCallback et les consigne dans un fichier emissions.csv, que l'utilisateur peut reporter dans la fiche du modèle. Une recherche avec un seuil maximal de 100 grammes renvoie 191 modèles, tandis qu'un seuil minimal de 500 grammes n'en retourne que 10.

12 avrilmar.
17 marsjeu.
16 marsmer.
2 févriermer.
23 décembrejeu.
8 décembremer.
29 novembrelun.
19 novembreven.
  1. Hugging Face Blog22

    Accélérer le fine-tuning distribué PyTorch avec les technologies Intel

    Intel détaille comment accélérer le fine-tuning distribué de PyTorch sur des clusters de serveurs Intel Xeon Scalable (architecture Ice Lake) via l'Intel extension for PyTorch et oneCCL. Le tutoriel fine-tune un modèle BERT sur le dataset MRPC (5 800 paires de phrases du benchmark GLUE), en comparant un job sur un seul serveur puis sur 2 et 4 serveurs pour mesurer le speed-up. Les instances utilisées sont des Amazon EC2 c6i.16xlarge (64 vCPUs, 128 Go de RAM, réseau 25 Gbit/s), avec des équivalents disponibles chez Azure et Google Cloud.

15 novembrelun.
26 octobremar.
25 octobrelun.
13 octobremer.
28 juinlun.
8 avriljeu.
9 marsmar.
25 févrierjeu.
9 févriermar.
  1. Hugging Face Blog60

    Hugging Face sur PyTorch/XLA TPU : entraîner des Transformers sur Cloud TPU

    Hugging Face et les équipes PyTorch et Google TPU présentent l'intégration de PyTorch/XLA dans la bibliothèque Transformers.

    Motif de la recommandation :L'article détaille l'intégration de PyTorch/XLA dans les Trainer Hugging Face et fournit un exemple complet d'entraînement de bert-large-uncased sur Cloud TPU.

19 janviermar.
  1. Hugging Face Blog62

    Comment entraîner plus vite et plus gros avec ZeRO via DeepSpeed et FairScale

    Le blog Hugging Face détaille l'intégration expérimentale de ZeRO de DeepSpeed et FairScale dans le Trainer de transformers à partir de la v4.2.0.

    Motif de la recommandation :L'article compare les gains de ZeRO via DeepSpeed et FairScale sur t5-large et t5-3b, avec des chiffres de temps et de batch size directement réutilisables.

14 févrierven.