Hugging Face présente le Time Series Transformer, un modèle probabiliste de prévision de séries temporelles intégré à la bibliothèque 🤗 Transformers. Ce modèle encodeur-décodeur.
Grâce aux ingénieurs d'Apple, il est désormais possible d'exécuter Stable Diffusion sur Apple Silicon via Core ML. Le dépôt Apple fournit des scripts de conversion et du code d'inférence basés sur Diffusers, et les poids convertis des modèles Stable Diffusion v1.4, v1.5, v2 base et v2.1 base sont disponibles sur le Hugging Face Hub. Core ML prend en charge le CPU, le GPU et le Neural Engine, avec des variantes d'attention original et split_einsum ainsi que des formats packages pour Python et compilés pour Swift. Sur un MacBook Pro M1 Max avec macOS Ventura 13.1 Beta 4, la génération d'une image avec Stable Diffusion v1.4 a pris 18 secondes.
Motif de la recommandation :Le guide détaille les variantes de modèles Core ML et les commandes Python et Swift pour exécuter Stable Diffusion localement sur Apple Silicon.
Motif de la recommandation :L'article partage des réglages testés pour entraîner Stable Diffusion avec Dreambooth, notamment learning rate, étapes et prior preservation, ce qui aide à éviter le surapprentissage.
Hugging Face lance Inference Endpoints, un service qui déploie des modèles du hub vers une infrastructure managée sur le cloud en quelques clics. Le service propose trois niveaux d'accès — Public, Protected et Private — le mode Private passant par AWS PrivateLink et un VPC Endpoint pour restreindre l'accès au compte AWS. L'exemple déploie un modèle Swin de classification d'images fine-tuné avec AutoTrain sur food101, sur une instance GPU unique hébergée sur AWS en eu-west-1, avec autoscaling et conteneur personnalisé en option.
Motif de la recommandation :Présente la prise en charge de Flax dans Diffusers et détaille le déploiement parallèle de Stable Diffusion sur TPU, une méthode directement réutilisable.
Motif de la recommandation :L'article détaille le mécanisme de chargement par sharding et de répartition sur plusieurs appareils, une méthode directement transférable pour exécuter de grands modèles sur du matériel limité.
Motif de la recommandation :L'article compare trois solutions d'inférence pour BLOOM 176B avec des chiffres de débit et de chargement, utile pour choisir un schéma de déploiement.
Motif de la recommandation :L'article détaille l'utilisation de Stable Diffusion avec la bibliothèque Diffusers, du code d'inférence de base à la construction d'un pipeline personnalisé, avec des explications sur les composants du modèle.
Hugging Face publie un guide pas à pas pour fine-tuner des modèles Transformer pré-entraînés sur les IPU de Graphcore via la bibliothèque Optimum. L'exemple entraîne un modèle ViT pré-entraîné sur ImageNet-21k sur le jeu de données ChestX-ray14, en s'appuyant sur les checkpoints et fichiers de configuration IPU déjà disponibles dans Optimum Graphcore. Les IPU sont présentés comme particulièrement adaptés aux ViT grâce au parallélisme de données et de modèle, au pipeline et à l'architecture MIMD avec IPU-Fabric.
Motif de la recommandation :L'article détaille l'intégration de LLM.int8() dans transformers et accelerate, avec les pièges de chargement et les compromis de vitesse.
Hugging Face explique comment passer d'un déploiement local d'un modèle Vision Transformer (ViT) de 🤗 Transformers avec TensorFlow Serving à un déploiement scalable sur Kubernetes via Docker. Le modèle SavedModel est placé dans une structure de répertoires versionnée (hf-vit/1), copié dans un conteneur basé sur l'image officielle tensorflow/serving, puis commité en une nouvelle image Docker exposant les ports 8500 (gRPC) et 8501 (HTTP/REST). Le guide utilise Google Kubernetes Engine (GKE) pour provisionner le cluster, tout en précisant que les concepts s'appliquent aussi à Minikube.
L'équipe BigScience de Hugging Face détaille l'infrastructure matérielle et logicielle utilisée pour entraîner le modèle multilingue BLOOM de 176 milliards de paramètres. L'entraînement a mobilisé 384 GPU NVIDIA A100 80GB répartis sur 48 nœuds, avec une architecture GPT-3 enrichie, un jeu de données de 350 milliards de tokens couvrant 46 langues, et une durée d'environ 3,5 mois sur le supercalculateur Jean Zay. Le framework Megatron-DeepSpeed combine le parallélisme de données ZeRO, le parallélisme tensoriel de Megatron-LM et le parallélisme de pipeline pour répartir l'entraînement, tandis que le format BF16 et des kernels CUDA fusionnés ont permis de stabiliser et d'accélérer le processus.
Hugging Face publie un guide pour débutants qui utilise Sentence Transformers (ST) comme exemple pour passer de zéro à un premier projet ML autonome. ST transforme des phrases en embeddings vectoriels et fournit la fonction util.cos_sim pour calculer la similarité cosinus (score de -1 à 1), avec le modèle msmarco-MiniLM-L-6-v3 chargé dans un Jupyter notebook. La bibliothèque compte près de 8 000 étoiles sur GitHub et plus de 3 000 projets et packages qui en dépendent, et sert à la recherche sémantique, au clustering, à la distillation de modèles ou à CLIP.
Hugging Face montre comment entraîner de grands modèles avec la bibliothèque Accelerate en exploitant les fonctionnalités ZeRO de DeepSpeed sans modifier le code. Sur 2 GPU NVIDIA Titan RTX 24 Go, le fine-tuning de microsoft/deberta-v2-xlarge-mnli (900M paramètres) sur MRPC atteint une taille de batch de 40 contre 8 pour DDP, soit 5X plus de données par GPU et environ 3.5X d'accélération de l'entraînement (28.98 s contre 103.57 s par époque), sans baisse du F1 (0.936) ni de l'accuracy (0.912). Un fichier de configuration DeepSpeed permet d'ajuster davantage d'options, illustré par le fine-tuning de facebook/blenderbot-400M-distill sur le dataset MuDoConv.
Hugging Face publie un tutoriel pour créer un moteur de FAQ en embeddant un jeu de données avec la Hugging Face Inference API et le modèle open source sentence-transformers/all-MiniLM-L6-v2. Les embeddings, vecteurs de 384 nombres capturant le sens sémantique de textes ou d'images, permettent de comparer une requête utilisateur aux questions du jeu de données pour identifier la FAQ la plus proche. Le tutoriel détaille l'embedding des FAQ Medicare, leur hébergement gratuit sur le Hub et la comparaison sémantique des requêtes.
Hugging Face publie un article de blog qui détaille les modèles de diffusion probabilistes de débruitage (DDPM) et les implémente pas à pas en PyTorch.
Motif de la recommandation :Implémentation pas à pas du DDPM en PyTorch, avec code exécutable et explications mathématiques, utile pour comprendre les modèles de diffusion.