Aller au contenu
24 févrierven.
3 févrierven.
20 janvierven.
3 janviermar.
14 décembremer.
2 décembreven.
1 décembrejeu.
17 novembrejeu.
8 novembremar.
19 octobremer.
  1. Hugging Face Blog60

    MTEB : un benchmark massif pour les modèles d'embedding de texte

    Hugging Face présente MTEB, un benchmark massif destiné à mesurer les performances des modèles d'embedding de texte sur des tâches variées. Il regroupe 56 jeux de données répartis en 8 tâches, jusqu'à 112 langues, et un classement public de plus de 2000 résultats. La bibliothèque MTEB permet d'évaluer n'importe quel modèle produisant des embeddings et de soumettre ses résultats au classement.

    Motif de la recommandation :Le MTEB couvre 56 jeux de données et 8 tâches, avec un classement public et une bibliothèque réutilisable pour évaluer les modèles d'embedding.

26 septembrelun.
  1. Hugging Face Blog62

    SetFit : un apprentissage efficace en few-shot sans prompts

    Hugging Face, avec Intel Labs et le UKP Lab, présente SetFit, un framework d'apprentissage en few-shot pour les Sentence Transformers. Sur le jeu de données CR.

    Motif de la recommandation :L'article présente la méthode d'entraînement en deux étapes de SetFit et les résultats comparatifs sur RAFT, permettant de comprendre pourquoi un petit modèle peut atteindre les performances de T-Few.

8 septembrejeu.
18 aoûtjeu.
  1. Hugging Face Blog22

    Hugging Face Optimum Graphcore : guide de fine-tuning des Vision Transformers sur IPU

    Hugging Face publie un guide pas à pas pour fine-tuner des modèles Transformer pré-entraînés sur les IPU de Graphcore via la bibliothèque Optimum. L'exemple entraîne un modèle ViT pré-entraîné sur ImageNet-21k sur le jeu de données ChestX-ray14, en s'appuyant sur les checkpoints et fichiers de configuration IPU déjà disponibles dans Optimum Graphcore. Les IPU sont présentés comme particulièrement adaptés aux ViT grâce au parallélisme de données et de modèle, au pipeline et à l'architecture MIMD avec IPU-Fabric.

10 aoûtmer.
5 aoûtven.
2 aoûtmar.
22 juilletven.
13 juilletmer.
30 juinjeu.
7 juinmar.
  1. Hugging Face Blog62

    Le modèle de diffusion annoté : implémentation pas à pas du DDPM en PyTorch

    Hugging Face publie un article de blog qui détaille les modèles de diffusion probabilistes de débruitage (DDPM) et les implémente pas à pas en PyTorch.

    Motif de la recommandation :Implémentation pas à pas du DDPM en PyTorch, avec code exécutable et explications mathématiques, utile pour comprendre les modèles de diffusion.

23 mailun.
  1. Hugging Face Blog30

    TAPEX : pré-entraînement efficace de tables sans données réelles

    Microsoft présente TAPEX, une méthode de pré-entraînement de tables qui apprend un exécuteur SQL neuronal sur un corpus synthétique généré en échantillonnant des requêtes SQL exécutables et leurs résultats, sans recourir à des données réelles. Intégré à Transformers 4.19.0, TAPEX atteint de nouveaux résultats SOTA sur quatre benchmarks : 89,6 % sur WikiSQL (+2,3 %), 84,2 % sur TabFact (+3,2 %), 74,5 % sur SQA (+3,5 %) et 57,5 % sur WikiTableQuestions (+4,8 %).

20 maiven.
18 maimer.
4 maimer.
28 marslun.
23 marsmer.
22 marsmar.
17 marsjeu.
2 marsmer.
25 janviermar.
15 décembremer.
25 octobrelun.
13 octobremer.
31 marsmer.
  1. Hugging Face Blog22

    Comprendre l'attention block sparse de BigBird

    BigBird, un modèle de type RoBERTa, est désormais disponible dans 🤗Transformers avec une attention block sparse qui gère des séquences jusqu'à 4096 tokens à un coût computationnel bien inférieur à celui de BERT. Cette attention approximative combine trois mécanismes — attention glissante sur les tokens voisins, tokens globaux attentifs à tous les autres, et tokens aléatoires — pour capturer les dépendances longue portée sans la complexité quadratique O(n²) de l'attention complète de BERT. BigBird a atteint l'état de l'art sur des tâches à longues séquences comme le résumé de longs documents et le question-answering à long contexte.

9 marsmar.
9 novembrelun.
3 juilletven.