Motif de la recommandation :L'annonce détaille la refonte du frontend et la nouvelle API Blocks, ce qui permet de juger comment construire des démos plus flexibles en Python.
Hugging Face et Habana Labs ont publié un guide pratique pour fine-tuner des modèles Transformers sur les accélérateurs Habana Gaudi via des instances Amazon EC2 DL1. Le tutoriel détaille le lancement d'une instance dl1.24xlarge équipée de 8 processeurs Gaudi, l'utilisation de l'AMI Habana Deep Learning et du conteneur PyTorch, puis le fine-tuning de bert-large-uncased-whole-word-masking sur la tâche MRPC du benchmark GLUE avec Optimum Habana. Le job atteint un score F1 de 0.8968 en 2 minutes et 12 secondes, pour un coût de $3.93 par heure en Spot Instance contre $13.11 en tarif standard, soit 70% d'économie.
Hugging Face montre comment automatiser le filtrage des messages clients mécontents en modélisant le problème comme une classification de texte à 5 classes (very unsatisfied à very satisfied). Le dataset Amazon reviews multi est retenu pour ses labels de sentiment de 1 à 5 étoiles, jugé plus adapté que GLUE, Amazon polarity ou Tweet eval. L'approche vise à répondre à 100 % des messages des clients les plus insatisfaits, supposés minoritaires parmi l'ensemble des retours.
Hugging Face ajoute à sa bibliothèque huggingface_hub un paramètre emissions_threshold permettant de filtrer les modèles du Hub selon les émissions de CO2 générées lors de leur entraînement. L'intégration de codecarbon dans transformers enregistre automatiquement ces émissions via CodeCarbonCallback et les consigne dans un fichier emissions.csv, que l'utilisateur peut reporter dans la fiche du modèle. Une recherche avec un seuil maximal de 100 grammes renvoie 191 modèles, tandis qu'un seuil minimal de 500 grammes n'en retourne que 10.
Hugging Face détaille le fine-tuning du Vision Transformer (ViT) pour la classification d'images via les bibliothèques 🤗 datasets et transformers. Le tutoriel s'appuie sur le modèle google/vit-base-patch16-224-in21k et le jeu de données beans (3 classes : angular_leaf_spot, bean_rust, healthy), en utilisant ViTImageProcessor pour redimensionner les images en 224×224 et les normaliser avec mean/std de 0,5. L'installation se fait via `pip install datasets transformers`.
Hugging Face a publié une étude de cas montrant que son conteneur Infinity, optimisé pour les processeurs Intel Xeon Ice Lake de 3e génération sur les instances Amazon EC2 C6i.
Motif de la recommandation :Décrit pas à pas la construction d'un jeu de données, d'un tokenizer et d'une boucle d'entraînement multi-GPU pour un modèle de génération de code.
Intel détaille comment accélérer le fine-tuning distribué de PyTorch sur des clusters de serveurs Intel Xeon Scalable (architecture Ice Lake) via l'Intel extension for PyTorch et oneCCL. Le tutoriel fine-tune un modèle BERT sur le dataset MRPC (5 800 paires de phrases du benchmark GLUE), en comparant un job sur un seul serveur puis sur 2 et 4 serveurs pour mesurer le speed-up. Les instances utilisées sont des Amazon EC2 c6i.16xlarge (64 vCPUs, 128 Go de RAM, réseau 25 Gbit/s), avec des équivalents disponibles chez Azure et Google Cloud.
Le rapport State of AI 2021 et l'enquête Kaggle ML & Data Science confirment que l'architecture Transformer s'impose comme architecture générale du Machine Learning.
Hugging Face annonce la sortie d'Optimum, une bibliothèque open source dédiée à l'optimisation des performances des Transformers en production. Elle vise à abstraire la complexité de l'accélération matérielle, en commençant par la quantification des modèles pour les CPU Intel Xeon via Intel Neural Compressor. Optimum s'appuie sur un programme de partenaires matériels et prévoit de publier des configurations et artefacts de modèles optimisés sur le Hugging Face Model Hub.
Motif de la recommandation :Hugging Face présente Optimum, une bibliothèque open source qui simplifie la quantification et l'accélération des Transformers sur du matériel dédié, avec Intel comme premier partenaire.
Motif de la recommandation :Gradio 2.0 permet de charger et combiner des modèles Hugging Face en une ligne, avec un exemple de traduction et résumé en trois lignes.
Hugging Face présente Accelerate, une bibliothèque qui permet d'exécuter un script d'entraînement PyTorch brut sur n'importe quel type de dispositif distribué (multi-GPU sur un ou plusieurs nœuds, TPU) et avec ou sans précision mixte, en ajoutant cinq lignes de code. Elle fournit une API unifiée qui abstrait le code répétitif et une commande de lancement pour exécuter les scripts sur différentes configurations. Les plans futurs incluent le support de fairscale, deepseed, ainsi que du parallélisme de données et de modèle spécifique à AWS SageMaker. L'installation se fait via pip install accelerate.
Motif de la recommandation :L'article détaille les cinq lignes à ajouter à un script PyTorch pour exécuter l'entraînement distribué et la précision mixte, avec le lanceur CLI et la configuration.
BigBird, un modèle de type RoBERTa, est désormais disponible dans 🤗Transformers avec une attention block sparse qui gère des séquences jusqu'à 4096 tokens à un coût computationnel bien inférieur à celui de BERT. Cette attention approximative combine trois mécanismes — attention glissante sur les tokens voisins, tokens globaux attentifs à tous les autres, et tokens aléatoires — pour capturer les dépendances longue portée sans la complexité quadratique O(n²) de l'attention complète de BERT. BigBird a atteint l'état de l'art sur des tâches à longues séquences comme le résumé de longs documents et le question-answering à long contexte.
Hugging Face détaille le fine-tuning de Wav2Vec2, modèle de reconnaissance automatique de la parole pré-entraîné sur plus de 50 000 heures d'audio non étiqueté.
Motif de la recommandation :L'article détaille l'intégration de PyTorch/XLA dans les Trainer Hugging Face et fournit un exemple complet d'entraînement de bert-large-uncased sur Cloud TPU.
Motif de la recommandation :L'article compare les gains de ZeRO via DeepSpeed et FairScale sur t5-large et t5-3b, avec des chiffres de temps et de batch size directement réutilisables.
Le notebook Hugging Face détaille comment initialiser à chaud (warm-start) des modèles encodeur-décodeur à partir de checkpoints pré-entraînés de type BERT ou GPT2.