Écosystème open source de génération de texte et de LLM chez Hugging Face
Hugging Face présente son écosystème open source pour la génération de texte et les LLM.
Hugging Face présente son écosystème open source pour la génération de texte et les LLM.
Hugging Face détaille le fine-tuning d'un modèle Stable Diffusion sur un cluster de quatre serveurs Intel Sapphire Rapids.
Transformers.js permet de faire tourner des modèles ML directement dans le navigateur, sans serveur, comme le démontre le jeu Doodle Dash inspiré de Quick, Draw!
Hugging Face montre comment déployer des LLM open source comme Falcon 40B instruct via Inference Endpoints.
Hugging Face détaille un tutoriel pour construire un générateur d'applications web combinant Node.js et le modèle WizardCoder-15B servi via l'API Inference Endpoints. Le serveur Express diffuse en streaming le HTML généré token par token directement au navigateur, avec un prompt guidant le modèle vers TailwindCSS et une logique JS encapsulée. Une alternative gratuite via l'Inference API est proposée pour les modèles plus petits, tandis que les modèles performants nécessitent 32 Go de mémoire ou plus et une accélération matérielle pour une latence correcte.
Optimum Habana v1.7 sur Habana Gaudi2 atteint des accélérations de x2,5 par rapport à l'A100 et x1.
Panel et Hugging Face annoncent une collaboration intégrant un template Panel dans Hugging Face Spaces.
Le blog Hugging Face explique comment le fine-tuning des couches Adapter de MMS atteint un taux d'erreur de mots très faible après seulement 10 à 20 minutes d'entraînement.
Hugging Face présente les optimisations Core ML de WWDC'23 pour exécuter Stable Diffusion plus rapidement et avec moins de mémoire sur iPhone.
Motif de la recommandation :L'article détaille la quantification 6 bits de Core ML et fournit les commandes de conversion, permettant de reproduire le déploiement de Stable Diffusion sur appareil.
Livebook, l'outil open source de notebooks interactifs en Elixir.
Hugging Face annonce qu'AMD rejoint son Hardware Partner Program.
Hugging Face détaille l'intégration des modèles Falcon de TII, publiés sous licence Apache 2.0.
Motif de la recommandation :L'article détaille l'intégration de Falcon dans l'écosystème Hugging Face, avec des exemples d'inférence, de quantification et de fine-tuning directement réutilisables.
Hugging Face met à disposition un nouveau conteneur d'inférence LLM (DLC) pour Amazon SageMaker.
Hugging Face détaille un workflow d'optimisation de Stable Diffusion pour CPU Intel combinant Quantization-Aware Training (QAT) via NNCF.
Hugging Face et Microsoft lancent le Hugging Face Model Catalog.
Hugging Face annonce l'intégration de la quantification 4 bits via bitsandbytes dans transformers.
Motif de la recommandation :L'intégration de la quantification 4 bits et de QLoRA dans transformers permet d'entraîner des modèles 65B sur un seul GPU 48GB, avec les benchmarks T4 fournis.
Hugging Face annonce un partenariat avec IBM sur watsonx.ai, la plateforme d'entreprise destinée aux développeurs d'IA pour entraîner.
Intel et Hugging Face présentent Q8-Chat, une expérience d'IA générative exécutant des LLM quantifiés en 8 bits sur CPU Xeon. La technique SmoothQuant-O3 compresse des modèles comme OPT 2.7B/6.7B, LLaMA 7B, Alpaca 7B, Vicuna 7B, BloomZ 7.1B et MPT-7B-chat d'un facteur ~2x, avec des métriques majoritairement en amélioration ou marginalement dégradées. Sur un Xeon Sapphire Rapids 32 cœurs, MPT-7B-chat génère du texte en temps réel avec un batch size de 1, offrant flexibilité IT et coût-performance sur CPU.
Le blog Hugging Face détaille comment exécuter Vicuna 13B, un chatbot open source de 13 milliards de paramètres développé par UC Berkeley.
Hugging Face présente la génération assistée, une méthode de décodage qui utilise un petit modèle assistant pour proposer des tokens candidats.
Motif de la recommandation :L'article détaille le goulot d'étranglement mémoire de la génération autoregressive et propose une méthode de décodage assisté avec des gains de latence mesurés.
Hugging Face détaille comment fine-tuner StarCoder, un modèle de 16B paramètres entraîné sur 80+ langages de programmation.
Motif de la recommandation :L'article détaille le fine-tuning de StarCoder avec ChatML et DeepSpeed ZeRO-3, une méthode transférable pour transformer un modèle de code en assistant conversationnel.
Hugging Face consacre un article aux modèles text-to-video.
Hugging Face Unity API, une intégration de la Hugging Face Inference API.
Hugging Face détaille l'entraînement from scratch d'un RoBERTa (modèle base) sur le jeu de données WikiText (v1) avec TensorFlow et TPU.
Le blog Hugging Face explique comment exécuter le modèle open source de génération d'images texte-image IF de DeepFloyd sur un Google Colab gratuit avec la bibliothèque diffusers. IF fonctionne directement dans l'espace pixel et utilise T5-XXL comme encodeur de texte, ce qui lui permet de générer des détails haute fréquence comme les visages et les mains ainsi que du texte dans les images, mais ses composants totalisent plus de 10 milliards de paramètres, avec T5-XXL à 20 Go et le UNet de l'étape 1 à 17,2 Go en float32. Le tutoriel montre comment charger T5 en quantification 8 bits via bitsandbytes, charger modulairement chaque composant avec device_map, libérer la mémoire GPU entre les étapes, et enchaîner les trois étapes de génération, de variation d'image et d'inpainting. L'auteur précise que cette configuration échange de la vitesse contre de la mémoire et n'est pas recommandée en production, où un A100 de 40 Go est préférable.
Motif de la recommandation :Détaille comment exécuter le modèle de génération d'images IF sur un Colab gratuit via quantification 8 bits et chargement modulaire, avec des étapes directement réutilisables.
Hugging Face s'associe à AWS pour optimiser Hugging Face Transformers sur Inferentia2.
Snorkel AI s'associe à Hugging Face pour intégrer les Inference Endpoints à sa plateforme Snorkel Flow.
Hugging Face publie StackLLaMA, un modèle LLaMA 7B entraîné avec RLHF pour répondre aux questions de Stack Exchange.
Motif de la recommandation :Le guide détaille tout le pipeline RLHF de StackLLaMA, du jeu de données à l'entraînement PPO, avec des configurations LoRA et des commandes réutilisables.
Habana Gaudi2 exécute l'inférence de BLOOMZ, un modèle de 176 milliards de paramètres.
Hugging Face et Flower permettent de fédérer le fine-tuning d'un Transformer pré-entraîné (distilBERT) sur un jeu de données IMDB pour la classification de sentiments.
Le modèle Informer (AAAI21 best paper) est désormais disponible dans 🤗 Transformers pour la prévision probabiliste multivariée de séries temporelles. Il remplace l'attention classique par la ProbSparse attention en O(T log T) et ajoute une opération de distillation réduisant la mémoire à O(N·T log T), contre O(T²D) et O(NT²) pour le Transformer vanilla. Le modèle prend en charge les émissions indépendantes (diagonales) pour les familles de distributions implémentées, et fonctionne aussi pour le Time Series Transformer vanilla.
Hugging Face annonce l'intégration officielle de trl avec peft.
Motif de la recommandation :Présente une méthode concrète pour exécuter un fine-tuning RLHF de modèle 20B sur un seul GPU 24GB, avec les étapes et les bibliothèques utilisées.
Après les séismes de magnitude 7,7 et 7,6 survenus le 6 février 2023 dans le sud-est de la Turquie.
Motif de la recommandation :L'auteur détaille la chaîne complète OCR, NER et classification d'intentions déployée après le séisme en Turquie, une méthode réutilisable pour des applications d'urgence.
Hugging Face a accompagné Witty Works, via son Expert Acceleration Program.
Fetch, société de récompenses shopping, a reconstruit sa plateforme IA avec Hugging Face sur AWS.
Hugging Face et AWS ont élargi leur partenariat stratégique de long terme pour démocratiser l'apprentissage automatique.
Hugging Face a lancé Inference Endpoints, un service managé permettant de déployer presque n'importe quel modèle du Hub sur AWS ou Azure.
Hugging Face annonce la bibliothèque PEFT, qui regroupe des techniques de fine-tuning économe en paramètres intégrées à Transformers et Accelerate. Elle prend en charge LoRA.
Motif de la recommandation :La bibliothèque PEFT de Hugging Face permet de fine-tuner des LLM avec une fraction des paramètres, ce qui réduit fortement les coûts de calcul et de stockage.
Hugging Face détaille l'inférence des Transformers PyTorch sur les CPU Intel Xeon Sapphire Rapids via Optimum Intel.
Hugging Face consacre le quatrième volet de sa série « AI for Game Development » à la génération d'assets 2D avec Stable Diffusion.