Motif de la recommandation :Décrit pas à pas la construction d'un jeu de données, d'un tokenizer et d'une boucle d'entraînement multi-GPU pour un modèle de génération de code.
Intel détaille comment accélérer le fine-tuning distribué de PyTorch sur des clusters de serveurs Intel Xeon Scalable (architecture Ice Lake) via l'Intel extension for PyTorch et oneCCL. Le tutoriel fine-tune un modèle BERT sur le dataset MRPC (5 800 paires de phrases du benchmark GLUE), en comparant un job sur un seul serveur puis sur 2 et 4 serveurs pour mesurer le speed-up. Les instances utilisées sont des Amazon EC2 c6i.16xlarge (64 vCPUs, 128 Go de RAM, réseau 25 Gbit/s), avec des équivalents disponibles chez Azure et Google Cloud.
Hugging Face explique comment utiliser GPT-Neo d'EleutherAI avec l'API Accelerated Inference pour générer des prédictions en few-shot learning. GPT-Neo (2.7B).
BigBird, un modèle de type RoBERTa, est désormais disponible dans 🤗Transformers avec une attention block sparse qui gère des séquences jusqu'à 4096 tokens à un coût computationnel bien inférieur à celui de BERT. Cette attention approximative combine trois mécanismes — attention glissante sur les tokens voisins, tokens globaux attentifs à tous les autres, et tokens aléatoires — pour capturer les dépendances longue portée sans la complexité quadratique O(n²) de l'attention complète de BERT. BigBird a atteint l'état de l'art sur des tâches à longues séquences comme le résumé de longs documents et le question-answering à long contexte.
Hugging Face détaille le fine-tuning de Wav2Vec2, modèle de reconnaissance automatique de la parole pré-entraîné sur plus de 50 000 heures d'audio non étiqueté.
Motif de la recommandation :L'article compare les gains de ZeRO via DeepSpeed et FairScale sur t5-large et t5-3b, avec des chiffres de temps et de batch size directement réutilisables.
Le notebook Hugging Face détaille comment initialiser à chaud (warm-start) des modèles encodeur-décodeur à partir de checkpoints pré-entraînés de type BERT ou GPT2.
Le blog Hugging Face détaille les quatre optimisations mémoire du Reformer, un modèle Transformer capable de traiter jusqu'à un demi-million de tokens en une seule passe.