BERT inférence sur CPU : comment passer à l'échelle (partie 1)
Hugging Face publie la première partie d'une série sur l'optimisation matérielle de l'inférence BERT sur CPU.
Hugging Face publie la première partie d'une série sur l'optimisation matérielle de l'inférence BERT sur CPU.
Hugging Face présente Accelerate, une bibliothèque qui permet d'exécuter un script d'entraînement PyTorch brut sur n'importe quel type de dispositif distribué (multi-GPU sur un ou plusieurs nœuds, TPU) et avec ou sans précision mixte, en ajoutant cinq lignes de code. Elle fournit une API unifiée qui abstrait le code répétitif et une commande de lancement pour exécuter les scripts sur différentes configurations. Les plans futurs incluent le support de fairscale, deepseed, ainsi que du parallélisme de données et de modèle spécifique à AWS SageMaker. L'installation se fait via pip install accelerate.
Motif de la recommandation :L'article détaille les cinq lignes à ajouter à un script PyTorch pour exécuter l'entraînement distribué et la précision mixte, avec le lanceur CLI et la configuration.
Hugging Face et Amazon SageMaker proposent des Deep Learning Containers optimisés pour 🤗 Transformers.
BigBird, un modèle de type RoBERTa, est désormais disponible dans 🤗Transformers avec une attention block sparse qui gère des séquences jusqu'à 4096 tokens à un coût computationnel bien inférieur à celui de BERT. Cette attention approximative combine trois mécanismes — attention glissante sur les tokens voisins, tokens globaux attentifs à tous les autres, et tokens aléatoires — pour capturer les dépendances longue portée sans la complexité quadratique O(n²) de l'attention complète de BERT. BigBird a atteint l'état de l'art sur des tâches à longues séquences comme le résumé de longs documents et le question-answering à long contexte.
Plus de 300 applications fournissent via l'API d'OpenAI des fonctions d'IA telles que la recherche, la conversation et la complétion de texte basées sur GPT-3.
Hugging Face et Amazon annoncent un partenariat stratégique faisant d'AWS le fournisseur cloud préféré de Hugging Face.
Un membre de la communauté Hugging Face déploie un pipeline d'analyse de sentiment Transformers en serverless sur Google Cloud Run.
Hugging Face détaille le fine-tuning de Wav2Vec2, modèle de reconnaissance automatique de la parole pré-entraîné sur plus de 50 000 heures d'audio non étiqueté.
Hugging Face publie un guide pratique sur la construction et le débogage de réseaux de neurones.
Huggingface Transformers a intégré Ray dans le mécanisme de récupération de documents contextuels du modèle RAG.
Hugging Face et les équipes PyTorch et Google TPU présentent l'intégration de PyTorch/XLA dans la bibliothèque Transformers.
Motif de la recommandation :L'article détaille l'intégration de PyTorch/XLA dans les Trainer Hugging Face et fournit un exemple complet d'entraînement de bert-large-uncased sur Cloud TPU.
OpenAI a étendu ses clusters Kubernetes à 7 500 nœuds, fournissant une infrastructure évolutive pour les grands modèles comme GPT-3.
Le blog Hugging Face détaille l'intégration expérimentale de ZeRO de DeepSpeed et FairScale dans le Trainer de transformers à partir de la v4.2.0.
Motif de la recommandation :L'article compare les gains de ZeRO via DeepSpeed et FairScale sur t5-large et t5-3b, avec des chiffres de temps et de batch size directement réutilisables.
Hugging Face a accéléré l'inférence Transformer d'un facteur 100 pour les abonnés de son Accelerated Inference API.
Le notebook Hugging Face détaille comment initialiser à chaud (warm-start) des modèles encodeur-décodeur à partir de checkpoints pré-entraînés de type BERT ou GPT2.
Le système de traduction fairseq wmt19 de Facebook FAIR a été porté vers la bibliothèque transformers de Hugging Face.
OpenAI a accepté d'accorder à Microsoft une licence de GPT-3 pour ses propres produits et services.
Hugging Face publie l'extension pytorch_block_sparse.
Le blog Hugging Face détaille les quatre optimisations mémoire du Reformer, un modèle Transformer capable de traiter jusqu'à un demi-million de tokens en une seule passe.
Le blog Hugging Face détaille les méthodes de décodage pour la génération de langage autorégressive avec la bibliothèque transformers.
OpenAI annonce standardiser son framework d'apprentissage profond sur PyTorch.
Microsoft investit 1 milliard de dollars dans OpenAI pour soutenir la construction d'une intelligence artificielle générale (AGI) aux bénéfices économiques largement distribués. Les deux entreprises s'associent pour développer sur Microsoft Azure une plateforme matérielle et logicielle évolutive vers l'AGI, et développeront conjointement de nouvelles technologies de supercalcul Azure AI. Microsoft devient le fournisseur cloud exclusif d'OpenAI.
OpenAI annonce travailler avec Microsoft pour commencer à exécuter la plupart de ses expériences à grande échelle sur Azure.
Le deep learning étant une science empirique, la qualité de l'infrastructure d'une équipe multiplie ses progrès. L'écosystème open source actuel permet à quiconque de construire une excellente infrastructure de deep learning.