Aller au contenu
5 aoûtven.
2 aoûtmar.
22 juilletven.
13 juilletmer.
30 juinjeu.
7 juinmar.
  1. Hugging Face Blog62

    Le modèle de diffusion annoté : implémentation pas à pas du DDPM en PyTorch

    Hugging Face publie un article de blog qui détaille les modèles de diffusion probabilistes de débruitage (DDPM) et les implémente pas à pas en PyTorch.

    Motif de la recommandation :Implémentation pas à pas du DDPM en PyTorch, avec code exécutable et explications mathématiques, utile pour comprendre les modèles de diffusion.

23 mailun.
  1. Hugging Face Blog30

    TAPEX : pré-entraînement efficace de tables sans données réelles

    Microsoft présente TAPEX, une méthode de pré-entraînement de tables qui apprend un exécuteur SQL neuronal sur un corpus synthétique généré en échantillonnant des requêtes SQL exécutables et leurs résultats, sans recourir à des données réelles. Intégré à Transformers 4.19.0, TAPEX atteint de nouveaux résultats SOTA sur quatre benchmarks : 89,6 % sur WikiSQL (+2,3 %), 84,2 % sur TabFact (+3,2 %), 74,5 % sur SQA (+3,5 %) et 57,5 % sur WikiTableQuestions (+4,8 %).

20 maiven.
18 maimer.
4 maimer.
28 marslun.
23 marsmer.
22 marsmar.
17 marsjeu.
2 marsmer.
25 janviermar.
15 décembremer.
25 octobrelun.
13 octobremer.
31 marsmer.
  1. Hugging Face Blog22

    Comprendre l'attention block sparse de BigBird

    BigBird, un modèle de type RoBERTa, est désormais disponible dans 🤗Transformers avec une attention block sparse qui gère des séquences jusqu'à 4096 tokens à un coût computationnel bien inférieur à celui de BERT. Cette attention approximative combine trois mécanismes — attention glissante sur les tokens voisins, tokens globaux attentifs à tous les autres, et tokens aléatoires — pour capturer les dépendances longue portée sans la complexité quadratique O(n²) de l'attention complète de BERT. BigBird a atteint l'état de l'art sur des tâches à longues séquences comme le résumé de longs documents et le question-answering à long contexte.

9 marsmar.
9 novembrelun.
3 juilletven.