Hugging Face lance le Private Hub pour le cycle de vie ML en entreprise
Hugging Face lance le Private Hub (PH), une plateforme unifiée d'outils ML couvrant de la recherche à la production.
Hugging Face lance le Private Hub (PH), une plateforme unifiée d'outils ML couvrant de la recherche à la production.
Nyströmformer approxime l'auto-attention standard avec une complexité O(n) en temps et en mémoire.
La génération de texte avec les modèles 🤗 transformers sous TensorFlow peut désormais être compilée avec XLA.
Hugging Face permet désormais de déployer localement un modèle Vision Transformer (ViT) de classification d'images via TensorFlow Serving.
L'équipe BigScience de Hugging Face détaille l'infrastructure matérielle et logicielle utilisée pour entraîner le modèle multilingue BLOOM de 176 milliards de paramètres. L'entraînement a mobilisé 384 GPU NVIDIA A100 80GB répartis sur 48 nœuds, avec une architecture GPT-3 enrichie, un jeu de données de 350 milliards de tokens couvrant 46 langues, et une durée d'environ 3,5 mois sur le supercalculateur Jean Zay. Le framework Megatron-DeepSpeed combine le parallélisme de données ZeRO, le parallélisme tensoriel de Megatron-LM et le parallélisme de pipeline pour répartir l'entraînement, tandis que le format BF16 et des kernels CUDA fusionnés ont permis de stabiliser et d'accélérer le processus.
Un développeur a construit un générateur de playlists basé sur Sentence Transformers et Gradio.
Hugging Face publie un guide pratique pour réaliser une analyse de sentiment sur Twitter.
Hugging Face montre comment entraîner de grands modèles avec la bibliothèque Accelerate en exploitant les fonctionnalités ZeRO de DeepSpeed sans modifier le code. Sur 2 GPU NVIDIA Titan RTX 24 Go, le fine-tuning de microsoft/deberta-v2-xlarge-mnli (900M paramètres) sur MRPC atteint une taille de batch de 40 contre 8 pour DDP, soit 5X plus de données par GPU et environ 3.5X d'accélération de l'entraînement (28.98 s contre 103.57 s par époque), sans baisse du F1 (0.936) ni de l'accuracy (0.912). Un fichier de configuration DeepSpeed permet d'ajuster davantage d'options, illustré par le fine-tuning de facebook/blenderbot-400M-distill sur le dataset MuDoConv.
Hugging Face publie un tutoriel pour créer un moteur de FAQ en embeddant un jeu de données avec la Hugging Face Inference API et le modèle open source sentence-transformers/all-MiniLM-L6-v2. Les embeddings, vecteurs de 384 nombres capturant le sens sémantique de textes ou d'images, permettent de comparer une requête utilisateur aux questions du jeu de données pour identifier la FAQ la plus proche. Le tutoriel détaille l'embedding des FAQ Medicare, leur hébergement gratuit sur le Hub et la comparaison sémantique des requêtes.
Hugging Face Optimum permet de convertir un modèle Transformers en ONNX via ORTModelForSequenceClassification et from_transformers=True.
Intel rejoint le Hardware Partner Program de Hugging Face et les deux entreprises collaborent via la bibliothèque open source Optimum pour accélérer l'entraînement.
Hugging Face publie la troisième partie de sa série « Director of Machine Learning Insights ».
OpenAI détaille les techniques d'ingénierie et de recherche nécessaires pour entraîner de grands réseaux de neurones.
Graphcore et Hugging Face élargissent Hugging Face Optimum avec 10 modèles Transformer prêts pour l'IPU.
OpenAI annonce que Codex alimente désormais 70 applications différentes couvrant divers cas d'usage, via l'API OpenAI.
Sempre Health a déployé un pipeline NLP qui traite automatiquement près de 20 % des messages entrants.
Hugging Face annonce Gradio 3.0, une refonte complète de la bibliothèque de démos ML.
Motif de la recommandation :L'annonce détaille la refonte du frontend et la nouvelle API Blocks, ce qui permet de juger comment construire des démos plus flexibles en Python.
Hugging Face ajoute le support de l'inférence et des pipelines Transformers à Optimum avec la version 1.2.
Hugging Face annonce l'intégration de fastai au Hugging Face Hub.
Hugging Face montre comment entraîner de grands modèles via Accelerate en exploitant PyTorch FullyShardedDataParallel (FSDP).
Hugging Face et Habana Labs ont publié un guide pratique pour fine-tuner des modèles Transformers sur les accélérateurs Habana Gaudi via des instances Amazon EC2 DL1. Le tutoriel détaille le lancement d'une instance dl1.24xlarge équipée de 8 processeurs Gaudi, l'utilisation de l'AMI Habana Deep Learning et du conteneur PyTorch, puis le fine-tuning de bert-large-uncased-whole-word-masking sur la tâche MRPC du benchmark GLUE avec Optimum Habana. Le job atteint un score F1 de 0.8968 en 2 minutes et 12 secondes, pour un coût de $3.93 par heure en Spot Instance contre $13.11 en tarif standard, soit 70% d'économie.
Hugging Face montre comment automatiser le filtrage des messages clients mécontents en modélisant le problème comme une classification de texte à 5 classes (very unsatisfied à very satisfied). Le dataset Amazon reviews multi est retenu pour ses labels de sentiment de 1 à 5 étoiles, jugé plus adapté que GLUE, Amazon polarity ou Tweet eval. L'approche vise à répondre à 100 % des messages des clients les plus insatisfaits, supposés minoritaires parmi l'ensemble des retours.
L'auteur teste le système d'échange d'outils WhamBam MUTANT V2.
Motif de la recommandation :L'auteur détaille l'installation, le câblage, la configuration firmware et les compromis d'espace d'impression du système MUTANT V2, avec des retours d'usage réels.
Hugging Face ajoute à sa bibliothèque huggingface_hub un paramètre emissions_threshold permettant de filtrer les modèles du Hub selon les émissions de CO2 générées lors de leur entraînement. L'intégration de codecarbon dans transformers enregistre automatiquement ces émissions via CodeCarbonCallback et les consigne dans un fichier emissions.csv, que l'utilisateur peut reporter dans la fiche du modèle. Une recherche avec un seuil maximal de 100 grammes renvoie 191 modèles, tandis qu'un seuil minimal de 500 grammes n'en retourne que 10.
Hugging Face explique que sa bibliothèque Transformers applique volontairement une « single model file policy » plutôt que le principe DRY.
Hugging Face et AWS proposent un tutoriel de bout en bout pour accélérer l'inférence de BERT en texte avec Transformers.
BERT (Bidirectional Encoder Representations from Transformers), développé en 2018 par Google AI Language.
Hugging Face détaille le fine-tuning du Vision Transformer (ViT) pour la classification d'images via les bibliothèques 🤗 datasets et transformers. Le tutoriel s'appuie sur le modèle google/vit-base-patch16-224-in21k et le jeu de données beans (3 classes : angular_leaf_spot, bean_rust, healthy), en utilisant ViTImageProcessor pour redimensionner les images en 224×224 et les normaliser avec mean/std de 0,5. L'installation se fait via `pip install datasets transformers`.
Hugging Face publie un guide de démarrage de l'analyse de sentiment en Python.
OpenAI annonce l'ajout d'embeddings, un nouveau point d'accès dans l'API OpenAI.
Motif de la recommandation :L'original présente un nouveau point d'accès API pour les embeddings, ce qui permet de juger comment intégrer recherche sémantique et classification dans les flux existants.
Hugging Face a publié une étude de cas montrant que son conteneur Infinity, optimisé pour les processeurs Intel Xeon Ice Lake de 3e génération sur les instances Amazon EC2 C6i.
🤗 Transformers intègre désormais pyctcdecode de Kensho Technologies.
Hugging Face explique comment déployer GPT-J 6B, le modèle open source de 6 milliards de paramètres d'EleutherAI.
OpenAI présente la personnalisation de GPT-3 pour votre application, avec un fine-tuning réalisable en une seule commande.
CNC Kitchen remplace la carte électronique propriétaire de son imprimante Cetus MK3 par une Mellow FLY RRF E3 à environ 60 dollars.
Motif de la recommandation :L'auteur documente le remplacement de la carte propriétaire d'une Cetus MK3 par une Mellow FLY RRF E3, avec adaptateur, câblage et configuration RepRapFirmware.
Hugging Face détaille l'entraînement depuis zéro de CodeParrot, un modèle GPT-2 de 1.
Motif de la recommandation :Décrit pas à pas la construction d'un jeu de données, d'un tokenizer et d'une boucle d'entraînement multi-GPU pour un modèle de génération de code.
Intel détaille comment accélérer le fine-tuning distribué de PyTorch sur des clusters de serveurs Intel Xeon Scalable (architecture Ice Lake) via l'Intel extension for PyTorch et oneCCL. Le tutoriel fine-tune un modèle BERT sur le dataset MRPC (5 800 paires de phrases du benchmark GLUE), en comparant un job sur un seul serveur puis sur 2 et 4 serveurs pour mesurer le speed-up. Les instances utilisées sont des Amazon EC2 c6i.16xlarge (64 vCPUs, 128 Go de RAM, réseau 25 Gbit/s), avec des équivalents disponibles chez Azure et Google Cloud.
Intel détaille les optimisations logicielles oneAPI pour accélérer l'inférence des modèles de type BERT sur les CPU Xeon Ice Lake.
Microsoft et NVIDIA ont présenté Megatron-Turing NLG 530B.
Le rapport State of AI 2021 et l'enquête Kaggle ML & Data Science confirment que l'architecture Transformer s'impose comme architecture générale du Machine Learning.