Motif de la recommandation :L'audit externe confirme l'absence de faille critique et le passage de safetensors au statut de dépendance par défaut dans transformers.
Hugging Face explore le fine-tuning par instructions de Stable Diffusion en s'appuyant sur la méthode InstructPix2Pix pour suivre des instructions d'édition précises comme la cartoonisation ou le débruitage d'image. Le pipeline génère 50 phrases synonymes via ChatGPT pour l'instruction « Cartoonize the image », puis utilise 5000 échantillons d'Imagenette traités par un modèle Whitebox CartoonGAN pré-entraîné comme labels. Le code, les modèles pré-entraînés et les datasets sont publiés en open source.
Intel et Hugging Face présentent Q8-Chat, une expérience d'IA générative exécutant des LLM quantifiés en 8 bits sur CPU Xeon. La technique SmoothQuant-O3 compresse des modèles comme OPT 2.7B/6.7B, LLaMA 7B, Alpaca 7B, Vicuna 7B, BloomZ 7.1B et MPT-7B-chat d'un facteur ~2x, avec des métriques majoritairement en amélioration ou marginalement dégradées. Sur un Xeon Sapphire Rapids 32 cœurs, MPT-7B-chat génère du texte en temps réel avec un batch size de 1, offrant flexibilité IT et coût-performance sur CPU.
Motif de la recommandation :L'article détaille l'intégration de l'architecture RWKV dans transformers et fournit des exemples de code exécutables, ce qui permet de reproduire directement le flux de génération de texte.
Motif de la recommandation :L'article détaille le goulot d'étranglement mémoire de la génération autoregressive et propose une méthode de décodage assisté avec des gains de latence mesurés.
Motif de la recommandation :L'article détaille le fine-tuning de StarCoder avec ChatML et DeepSpeed ZeRO-3, une méthode transférable pour transformer un modèle de code en assistant conversationnel.
Motif de la recommandation :StarCoder est publié avec ses poids, sa licence et ses benchmarks, ce qui permet de comparer directement ses performances à celles des modèles ouverts et fermés.
Le blog Hugging Face explique comment exécuter le modèle open source de génération d'images texte-image IF de DeepFloyd sur un Google Colab gratuit avec la bibliothèque diffusers. IF fonctionne directement dans l'espace pixel et utilise T5-XXL comme encodeur de texte, ce qui lui permet de générer des détails haute fréquence comme les visages et les mains ainsi que du texte dans les images, mais ses composants totalisent plus de 10 milliards de paramètres, avec T5-XXL à 20 Go et le UNet de l'étape 1 à 17,2 Go en float32. Le tutoriel montre comment charger T5 en quantification 8 bits via bitsandbytes, charger modulairement chaque composant avec device_map, libérer la mémoire GPU entre les étapes, et enchaîner les trois étapes de génération, de variation d'image et d'inpainting. L'auteur précise que cette configuration échange de la vitesse contre de la mémoire et n'est pas recommandée en production, où un A100 de 40 Go est préférable.
Motif de la recommandation :Détaille comment exécuter le modèle de génération d'images IF sur un Colab gratuit via quantification 8 bits et chargement modulaire, avec des étapes directement réutilisables.
Motif de la recommandation :Le guide détaille tout le pipeline RLHF de StackLLaMA, du jeu de données à l'entraînement PPO, avec des configurations LoRA et des commandes réutilisables.
Hugging Face et Flower permettent de fédérer le fine-tuning d'un Transformer pré-entraîné (distilBERT) sur un jeu de données IMDB pour la classification de sentiments.
Le modèle Informer (AAAI21 best paper) est désormais disponible dans 🤗 Transformers pour la prévision probabiliste multivariée de séries temporelles. Il remplace l'attention classique par la ProbSparse attention en O(T log T) et ajoute une opération de distillation réduisant la mémoire à O(N·T log T), contre O(T²D) et O(NT²) pour le Transformer vanilla. Le modèle prend en charge les émissions indépendantes (diagonales) pour les familles de distributions implémentées, et fonctionne aussi pour le Time Series Transformer vanilla.
Motif de la recommandation :Présente une méthode concrète pour exécuter un fine-tuning RLHF de modèle 20B sur un seul GPU 24GB, avec les étapes et les bibliothèques utilisées.
Kakao Brain et Hugging Face publient le jeu de données image-texte open source COYO de 700 millions de paires et deux modèles de vision-langage entraînés dessus.
Motif de la recommandation :Kakao Brain ouvre le jeu de données COYO et les modèles ViT et ALIGN, permettant aux chercheurs de reproduire l'entraînement multimodal avec accès aux données.
Motif de la recommandation :L'auteur détaille la chaîne complète OCR, NER et classification d'intentions déployée après le séisme en Turquie, une méthode réutilisable pour des applications d'urgence.
Motif de la recommandation :Le guide détaille l'intégration de ControlNet dans Diffusers avec des exemples de code exécutables et des optimisations de vitesse et de mémoire.
Motif de la recommandation :Présente le fonctionnement de Q-Former et des exemples de code exécutables pour la légende d'images, le VQA et le dialogue multimodal.