Le modèle Informer (AAAI21 best paper) est désormais disponible dans 🤗 Transformers pour la prévision probabiliste multivariée de séries temporelles. Il remplace l'attention classique par la ProbSparse attention en O(T log T) et ajoute une opération de distillation réduisant la mémoire à O(N·T log T), contre O(T²D) et O(NT²) pour le Transformer vanilla. Le modèle prend en charge les émissions indépendantes (diagonales) pour les familles de distributions implémentées, et fonctionne aussi pour le Time Series Transformer vanilla.
Motif de la recommandation :L'auteur détaille la chaîne complète OCR, NER et classification d'intentions déployée après le séisme en Turquie, une méthode réutilisable pour des applications d'urgence.
Motif de la recommandation :Présente le fonctionnement de Q-Former et des exemples de code exécutables pour la légende d'images, le VQA et le dialogue multimodal.
Hugging Face consacre le cinquième volet de sa série « AI for Game Development » à l'usage de ChatGPT pour écrire l'histoire d'un jeu de ferme. Le modèle reproduit d'abord des récits existants proches de Stardew Valley, puis s'améliore par allers-retours successifs, mais montre des limites : répétition sur les contenus longs, risques juridiques, éthiques et commerciaux en cas d'usage direct des sorties. L'auteur recommande de réserver ChatGPT au brainstorming et à la rédaction d'ébauches, la rédaction finale restant manuelle.
Motif de la recommandation :Le texte détaille l'intégration de LoRA dans diffusers avec un script exécutable et des besoins matériels précis, utile pour reproduire le fine-tuning.
Construire un système de similarité d'images avec les bibliothèques 🤗 Datasets et Transformers en calculant des embeddings via un modèle ViT (nateraw/vit-base-beans) et une similarité cosinus. Le système utilise 100 échantillons du dataset Beans comme candidats, et peut être étendu à d'autres modèles vision comme Swin Transformer, ConvNeXT ou RegNet.
Hugging Face publie un guide complet sur l'utilisation de la bibliothèque open source 🤗 Datasets pour télécharger et préparer des datasets audio en une seule ligne de code Python via la fonction load_dataset. Le Hub héberge 77 datasets de reconnaissance vocale et 28 datasets de classification audio, avec un aperçu permettant d'écouter les échantillons directement. Le mode streaming et le chargement de GigaSpeech (configurations de xs à xl, de 10 à 10 000 heures) illustrent la simplicité de l'API.
Hugging Face présente le Time Series Transformer, un modèle probabiliste de prévision de séries temporelles intégré à la bibliothèque 🤗 Transformers. Ce modèle encodeur-décodeur.
Grâce aux ingénieurs d'Apple, il est désormais possible d'exécuter Stable Diffusion sur Apple Silicon via Core ML. Le dépôt Apple fournit des scripts de conversion et du code d'inférence basés sur Diffusers, et les poids convertis des modèles Stable Diffusion v1.4, v1.5, v2 base et v2.1 base sont disponibles sur le Hugging Face Hub. Core ML prend en charge le CPU, le GPU et le Neural Engine, avec des variantes d'attention original et split_einsum ainsi que des formats packages pour Python et compilés pour Swift. Sur un MacBook Pro M1 Max avec macOS Ventura 13.1 Beta 4, la génération d'une image avec Stable Diffusion v1.4 a pris 18 secondes.
Motif de la recommandation :Le guide détaille les variantes de modèles Core ML et les commandes Python et Swift pour exécuter Stable Diffusion localement sur Apple Silicon.
Motif de la recommandation :L'article partage des réglages testés pour entraîner Stable Diffusion avec Dreambooth, notamment learning rate, étapes et prior preservation, ce qui aide à éviter le surapprentissage.
Hugging Face lance Inference Endpoints, un service qui déploie des modèles du hub vers une infrastructure managée sur le cloud en quelques clics. Le service propose trois niveaux d'accès — Public, Protected et Private — le mode Private passant par AWS PrivateLink et un VPC Endpoint pour restreindre l'accès au compte AWS. L'exemple déploie un modèle Swin de classification d'images fine-tuné avec AutoTrain sur food101, sur une instance GPU unique hébergée sur AWS en eu-west-1, avec autoscaling et conteneur personnalisé en option.
Motif de la recommandation :Présente la prise en charge de Flax dans Diffusers et détaille le déploiement parallèle de Stable Diffusion sur TPU, une méthode directement réutilisable.
Motif de la recommandation :L'article détaille le mécanisme de chargement par sharding et de répartition sur plusieurs appareils, une méthode directement transférable pour exécuter de grands modèles sur du matériel limité.
Motif de la recommandation :L'article compare trois solutions d'inférence pour BLOOM 176B avec des chiffres de débit et de chargement, utile pour choisir un schéma de déploiement.
Motif de la recommandation :L'article détaille l'utilisation de Stable Diffusion avec la bibliothèque Diffusers, du code d'inférence de base à la construction d'un pipeline personnalisé, avec des explications sur les composants du modèle.