Déployer 🤗 ViT sur Vertex AI
Hugging Face montre comment déployer un modèle ViT B/16 de 🤗 Transformers sur Vertex AI.
Hugging Face montre comment déployer un modèle ViT B/16 de 🤗 Transformers sur Vertex AI.
Hugging Face publie un guide pas à pas pour fine-tuner des modèles Transformer pré-entraînés sur les IPU de Graphcore via la bibliothèque Optimum. L'exemple entraîne un modèle ViT pré-entraîné sur ImageNet-21k sur le jeu de données ChestX-ray14, en s'appuyant sur les checkpoints et fichiers de configuration IPU déjà disponibles dans Optimum Graphcore. Les IPU sont présentés comme particulièrement adaptés aux ViT grâce au parallélisme de données et de modèle, au pipeline et à l'architecture MIMD avec IPU-Fabric.
Hugging Face intègre LLM.int8() dans transformers et accelerate.
Motif de la recommandation :L'article détaille l'intégration de LLM.int8() dans transformers et accelerate, avec les pièges de chargement et les compromis de vitesse.
Hugging Face présente Skops, une bibliothèque qui permet d'héberger des modèles scikit-learn sur le Hugging Face Hub.
Hugging Face détaille sa philosophie d'intégration de TensorFlow dans la bibliothèque transformers.
Hugging Face explique comment passer d'un déploiement local d'un modèle Vision Transformer (ViT) de 🤗 Transformers avec TensorFlow Serving à un déploiement scalable sur Kubernetes via Docker. Le modèle SavedModel est placé dans une structure de répertoires versionnée (hf-vit/1), copié dans un conteneur basé sur l'image officielle tensorflow/serving, puis commité en une nouvelle image Docker exposant les ports 8500 (gRPC) et 8501 (HTTP/REST). Le guide utilise Google Kubernetes Engine (GKE) pour provisionner le cluster, tout en précisant que les concepts s'appliquent aussi à Minikube.
Hugging Face consacre l'unité 8 de son cours gratuit de Deep Reinforcement Learning à Proximal Policy Optimization (PPO).
Hugging Face lance le Private Hub (PH), une plateforme unifiée d'outils ML couvrant de la recherche à la production.
Nyströmformer approxime l'auto-attention standard avec une complexité O(n) en temps et en mémoire.
La génération de texte avec les modèles 🤗 transformers sous TensorFlow peut désormais être compilée avec XLA.
Hugging Face permet désormais de déployer localement un modèle Vision Transformer (ViT) de classification d'images via TensorFlow Serving.
L'équipe BigScience de Hugging Face détaille l'infrastructure matérielle et logicielle utilisée pour entraîner le modèle multilingue BLOOM de 176 milliards de paramètres. L'entraînement a mobilisé 384 GPU NVIDIA A100 80GB répartis sur 48 nœuds, avec une architecture GPT-3 enrichie, un jeu de données de 350 milliards de tokens couvrant 46 langues, et une durée d'environ 3,5 mois sur le supercalculateur Jean Zay. Le framework Megatron-DeepSpeed combine le parallélisme de données ZeRO, le parallélisme tensoriel de Megatron-LM et le parallélisme de pipeline pour répartir l'entraînement, tandis que le format BF16 et des kernels CUDA fusionnés ont permis de stabiliser et d'accélérer le processus.
Un développeur a construit un générateur de playlists basé sur Sentence Transformers et Gradio.
Hugging Face publie un guide pratique pour réaliser une analyse de sentiment sur Twitter.
Hugging Face montre comment entraîner de grands modèles avec la bibliothèque Accelerate en exploitant les fonctionnalités ZeRO de DeepSpeed sans modifier le code. Sur 2 GPU NVIDIA Titan RTX 24 Go, le fine-tuning de microsoft/deberta-v2-xlarge-mnli (900M paramètres) sur MRPC atteint une taille de batch de 40 contre 8 pour DDP, soit 5X plus de données par GPU et environ 3.5X d'accélération de l'entraînement (28.98 s contre 103.57 s par époque), sans baisse du F1 (0.936) ni de l'accuracy (0.912). Un fichier de configuration DeepSpeed permet d'ajuster davantage d'options, illustré par le fine-tuning de facebook/blenderbot-400M-distill sur le dataset MuDoConv.
Hugging Face publie un tutoriel pour créer un moteur de FAQ en embeddant un jeu de données avec la Hugging Face Inference API et le modèle open source sentence-transformers/all-MiniLM-L6-v2. Les embeddings, vecteurs de 384 nombres capturant le sens sémantique de textes ou d'images, permettent de comparer une requête utilisateur aux questions du jeu de données pour identifier la FAQ la plus proche. Le tutoriel détaille l'embedding des FAQ Medicare, leur hébergement gratuit sur le Hub et la comparaison sémantique des requêtes.
Hugging Face Optimum permet de convertir un modèle Transformers en ONNX via ORTModelForSequenceClassification et from_transformers=True.
Intel rejoint le Hardware Partner Program de Hugging Face et les deux entreprises collaborent via la bibliothèque open source Optimum pour accélérer l'entraînement.
Hugging Face publie la troisième partie de sa série « Director of Machine Learning Insights ».
OpenAI détaille les techniques d'ingénierie et de recherche nécessaires pour entraîner de grands réseaux de neurones.
Graphcore et Hugging Face élargissent Hugging Face Optimum avec 10 modèles Transformer prêts pour l'IPU.
OpenAI annonce que Codex alimente désormais 70 applications différentes couvrant divers cas d'usage, via l'API OpenAI.
Sempre Health a déployé un pipeline NLP qui traite automatiquement près de 20 % des messages entrants.
Hugging Face annonce Gradio 3.0, une refonte complète de la bibliothèque de démos ML.
Motif de la recommandation :L'annonce détaille la refonte du frontend et la nouvelle API Blocks, ce qui permet de juger comment construire des démos plus flexibles en Python.
Hugging Face ajoute le support de l'inférence et des pipelines Transformers à Optimum avec la version 1.2.
Hugging Face annonce l'intégration de fastai au Hugging Face Hub.
Hugging Face montre comment entraîner de grands modèles via Accelerate en exploitant PyTorch FullyShardedDataParallel (FSDP).
Hugging Face et Habana Labs ont publié un guide pratique pour fine-tuner des modèles Transformers sur les accélérateurs Habana Gaudi via des instances Amazon EC2 DL1. Le tutoriel détaille le lancement d'une instance dl1.24xlarge équipée de 8 processeurs Gaudi, l'utilisation de l'AMI Habana Deep Learning et du conteneur PyTorch, puis le fine-tuning de bert-large-uncased-whole-word-masking sur la tâche MRPC du benchmark GLUE avec Optimum Habana. Le job atteint un score F1 de 0.8968 en 2 minutes et 12 secondes, pour un coût de $3.93 par heure en Spot Instance contre $13.11 en tarif standard, soit 70% d'économie.
Hugging Face montre comment automatiser le filtrage des messages clients mécontents en modélisant le problème comme une classification de texte à 5 classes (very unsatisfied à very satisfied). Le dataset Amazon reviews multi est retenu pour ses labels de sentiment de 1 à 5 étoiles, jugé plus adapté que GLUE, Amazon polarity ou Tweet eval. L'approche vise à répondre à 100 % des messages des clients les plus insatisfaits, supposés minoritaires parmi l'ensemble des retours.
Hugging Face ajoute à sa bibliothèque huggingface_hub un paramètre emissions_threshold permettant de filtrer les modèles du Hub selon les émissions de CO2 générées lors de leur entraînement. L'intégration de codecarbon dans transformers enregistre automatiquement ces émissions via CodeCarbonCallback et les consigne dans un fichier emissions.csv, que l'utilisateur peut reporter dans la fiche du modèle. Une recherche avec un seuil maximal de 100 grammes renvoie 191 modèles, tandis qu'un seuil minimal de 500 grammes n'en retourne que 10.
Hugging Face explique que sa bibliothèque Transformers applique volontairement une « single model file policy » plutôt que le principe DRY.
Hugging Face et AWS proposent un tutoriel de bout en bout pour accélérer l'inférence de BERT en texte avec Transformers.
BERT (Bidirectional Encoder Representations from Transformers), développé en 2018 par Google AI Language.
Hugging Face détaille le fine-tuning du Vision Transformer (ViT) pour la classification d'images via les bibliothèques 🤗 datasets et transformers. Le tutoriel s'appuie sur le modèle google/vit-base-patch16-224-in21k et le jeu de données beans (3 classes : angular_leaf_spot, bean_rust, healthy), en utilisant ViTImageProcessor pour redimensionner les images en 224×224 et les normaliser avec mean/std de 0,5. L'installation se fait via `pip install datasets transformers`.
Hugging Face publie un guide de démarrage de l'analyse de sentiment en Python.
OpenAI annonce l'ajout d'embeddings, un nouveau point d'accès dans l'API OpenAI.
Motif de la recommandation :L'original présente un nouveau point d'accès API pour les embeddings, ce qui permet de juger comment intégrer recherche sémantique et classification dans les flux existants.
Hugging Face a publié une étude de cas montrant que son conteneur Infinity, optimisé pour les processeurs Intel Xeon Ice Lake de 3e génération sur les instances Amazon EC2 C6i.
🤗 Transformers intègre désormais pyctcdecode de Kensho Technologies.
Hugging Face explique comment déployer GPT-J 6B, le modèle open source de 6 milliards de paramètres d'EleutherAI.
OpenAI présente la personnalisation de GPT-3 pour votre application, avec un fine-tuning réalisable en une seule commande.