Aller au contenu
17 juilletlun.
14 juilletven.
5 juilletmer.
4 juilletmar.
3 juilletlun.
  1. Hugging Face Blog22

    Créer un générateur d'applications web avec des modèles ML ouverts

    Hugging Face détaille un tutoriel pour construire un générateur d'applications web combinant Node.js et le modèle WizardCoder-15B servi via l'API Inference Endpoints. Le serveur Express diffuse en streaming le HTML généré token par token directement au navigateur, avec un prompt guidant le modèle vers TailwindCSS et une logique JS encapsulée. Une alternative gratuite via l'Inference API est proposée pour les modèles plus petits, tandis que les modèles performants nécessitent 32 Go de mémoire ou plus et une accélération matérielle pour une latence correcte.

29 juinjeu.
22 juinjeu.
19 juinlun.
15 juinjeu.
  1. Hugging Face Blog62

    Comment accélérer Stable Diffusion sur iPhone, iPad et Mac avec Core ML

    Hugging Face présente les optimisations Core ML de WWDC'23 pour exécuter Stable Diffusion plus rapidement et avec moins de mémoire sur iPhone.

    Motif de la recommandation :L'article détaille la quantification 6 bits de Core ML et fournit les commandes de conversion, permettant de reproduire le déploiement de Stable Diffusion sur appareil.

13 juinmar.
5 juinlun.
31 maimer.
25 maijeu.
24 maimer.
23 maimar.
16 maimar.
  1. Hugging Face Blog40

    Q8-Chat : une expérience d'IA générative efficace sur Xeon grâce à la quantification 8 bits

    Intel et Hugging Face présentent Q8-Chat, une expérience d'IA générative exécutant des LLM quantifiés en 8 bits sur CPU Xeon. La technique SmoothQuant-O3 compresse des modèles comme OPT 2.7B/6.7B, LLaMA 7B, Alpaca 7B, Vicuna 7B, BloomZ 7.1B et MPT-7B-chat d'un facteur ~2x, avec des métriques majoritairement en amélioration ou marginalement dégradées. Sur un Xeon Sapphire Rapids 32 cœurs, MPT-7B-chat génère du texte en temps réel avec un batch size de 1, offrant flexibilité IT et coût-performance sur CPU.

15 mailun.
11 maijeu.
  1. Hugging Face Blog62

    Hugging Face présente la génération assistée pour réduire la latence de génération de texte

    Hugging Face présente la génération assistée, une méthode de décodage qui utilise un petit modèle assistant pour proposer des tokens candidats.

    Motif de la recommandation :L'article détaille le goulot d'étranglement mémoire de la génération autoregressive et propose une méthode de décodage assisté avec des gains de latence mesurés.

9 maimar.
8 mailun.
1 mailun.
27 avriljeu.
26 avrilmer.
  1. Hugging Face Blog62

    Exécuter le modèle de génération d'images IF avec diffusers sur un Google Colab gratuit

    Le blog Hugging Face explique comment exécuter le modèle open source de génération d'images texte-image IF de DeepFloyd sur un Google Colab gratuit avec la bibliothèque diffusers. IF fonctionne directement dans l'espace pixel et utilise T5-XXL comme encodeur de texte, ce qui lui permet de générer des détails haute fréquence comme les visages et les mains ainsi que du texte dans les images, mais ses composants totalisent plus de 10 milliards de paramètres, avec T5-XXL à 20 Go et le UNet de l'étape 1 à 17,2 Go en float32. Le tutoriel montre comment charger T5 en quantification 8 bits via bitsandbytes, charger modulairement chaque composant avec device_map, libérer la mémoire GPU entre les étapes, et enchaîner les trois étapes de génération, de variation d'image et d'inpainting. L'auteur précise que cette configuration échange de la vitesse contre de la mémoire et n'est pas recommandée en production, où un A100 de 40 Go est préférable.

    Motif de la recommandation :Détaille comment exécuter le modèle de génération d'images IF sur un Colab gratuit via quantification 8 bits et chargement modulaire, avec des étapes directement réutilisables.

17 avrillun.
6 avriljeu.
5 avrilmer.
28 marsmar.
27 marslun.
10 marsven.
  1. Hugging Face Blog22

    Informer : prévision probabiliste multivariée de séries temporelles avec 🤗 Transformers

    Le modèle Informer (AAAI21 best paper) est désormais disponible dans 🤗 Transformers pour la prévision probabiliste multivariée de séries temporelles. Il remplace l'attention classique par la ProbSparse attention en O(T log T) et ajoute une opération de distillation réduisant la mémoire à O(N·T log T), contre O(T²D) et O(NT²) pour le Transformer vanilla. Le modèle prend en charge les émissions indépendantes (diagonales) pour les familles de distributions implémentées, et fonctionne aussi pour le Time Series Transformer vanilla.

9 marsjeu.
3 marsven.
1 marsmer.
23 févrierjeu.
21 févriermar.
15 févriermer.
10 févrierven.
  1. Hugging Face Blog62

    Hugging Face lance la bibliothèque PEFT pour un fine-tuning économe en paramètres

    Hugging Face annonce la bibliothèque PEFT, qui regroupe des techniques de fine-tuning économe en paramètres intégrées à Transformers et Accelerate. Elle prend en charge LoRA.

    Motif de la recommandation :La bibliothèque PEFT de Hugging Face permet de fine-tuner des LLM avec une fraction des paramètres, ce qui réduit fortement les coûts de calcul et de stockage.

6 févrierlun.
26 janvierjeu.