Aller au contenu

Formes de contenu

Tutoriels pratiques Dernières actualités

Du contenu pratique directement utilisable : astuces de prompting, mise en place de workflows, usage des outils et retours d'expérience sur les pièges.

58 sélections30 derniers jours 5 entréesTotal : 268 entrées

mise à jour

Archives de la sélection · page 3

26 avrilmer.41–58 entrées
  1. Hugging Face Blog62

    Exécuter le modèle de génération d'images IF avec diffusers sur un Google Colab gratuit

    Le blog Hugging Face explique comment exécuter le modèle open source de génération d'images texte-image IF de DeepFloyd sur un Google Colab gratuit avec la bibliothèque diffusers. IF fonctionne directement dans l'espace pixel et utilise T5-XXL comme encodeur de texte, ce qui lui permet de générer des détails haute fréquence comme les visages et les mains ainsi que du texte dans les images, mais ses composants totalisent plus de 10 milliards de paramètres, avec T5-XXL à 20 Go et le UNet de l'étape 1 à 17,2 Go en float32. Le tutoriel montre comment charger T5 en quantification 8 bits via bitsandbytes, charger modulairement chaque composant avec device_map, libérer la mémoire GPU entre les étapes, et enchaîner les trois étapes de génération, de variation d'image et d'inpainting. L'auteur précise que cette configuration échange de la vitesse contre de la mémoire et n'est pas recommandée en production, où un A100 de 40 Go est préférable.

    Motif de la recommandation :Détaille comment exécuter le modèle de génération d'images IF sur un Colab gratuit via quantification 8 bits et chargement modulaire, avec des étapes directement réutilisables.

5 avrilmer.
24 marsven.
3 marsven.
15 févriermer.
26 janvierjeu.
1 décembrejeu.
  1. Hugging Face Blog75

    Utiliser Stable Diffusion avec Core ML sur Apple Silicon

    Grâce aux ingénieurs d'Apple, il est désormais possible d'exécuter Stable Diffusion sur Apple Silicon via Core ML. Le dépôt Apple fournit des scripts de conversion et du code d'inférence basés sur Diffusers, et les poids convertis des modèles Stable Diffusion v1.4, v1.5, v2 base et v2.1 base sont disponibles sur le Hugging Face Hub. Core ML prend en charge le CPU, le GPU et le Neural Engine, avec des variantes d'attention original et split_einsum ainsi que des formats packages pour Python et compilés pour Swift. Sur un MacBook Pro M1 Max avec macOS Ventura 13.1 Beta 4, la génération d'une image avec Stable Diffusion v1.4 a pris 18 secondes.

    Motif de la recommandation :Le guide détaille les variantes de modèles Core ML et les commandes Python et Swift pour exécuter Stable Diffusion localement sur Apple Silicon.

7 novembrelun.
3 novembrejeu.
13 octobrejeu.
27 septembremar.
16 septembreven.
22 aoûtlun.
  1. Hugging Face Blog80

    Stable Diffusion avec 🧨 Diffusers : guide pratique et explication du fonctionnement

    Hugging Face présente comment utiliser Stable Diffusion, un modèle de diffusion latent texte-image créé par CompVis.

    Motif de la recommandation :L'article détaille l'utilisation de Stable Diffusion avec la bibliothèque Diffusers, du code d'inférence de base à la construction d'un pipeline personnalisé, avec des explications sur les composants du modèle.

17 aoûtmer.
7 juinmar.
  1. Hugging Face Blog62

    Le modèle de diffusion annoté : implémentation pas à pas du DDPM en PyTorch

    Hugging Face publie un article de blog qui détaille les modèles de diffusion probabilistes de débruitage (DDPM) et les implémente pas à pas en PyTorch.

    Motif de la recommandation :Implémentation pas à pas du DDPM en PyTorch, avec code exécutable et explications mathématiques, utile pour comprendre les modèles de diffusion.

1 févriermar.
  1. Hugging Face Blog62

    Faire fonctionner la reconnaissance vocale sur de grands fichiers avec Wav2Vec2 dans Transformers

    Hugging Face explique comment utiliser les spécificités de l'architecture CTC pour obtenir une reconnaissance vocale de bonne qualité sur des fichiers arbitrairement longs ou en inférence en direct avec Wav2Vec2. Le pipeline Transformers plante par manque de mémoire sur un fichier d'une heure, mais l'ajout de chunk_length_s=10 permet de traiter le fichier. La technique du chunking avec stride, qui exploite la correspondance CTC entre trames audio et prédictions de lettres, découpe l'audio en segments chevauchants, supprime les logits des bords et enchaîne les résultats pour se rapprocher de l'inférence sur le fichier complet. Elle fonctionne aussi sans modification sur les modèles Wav2Vec2 augmentés d'un LM, et peut être adaptée à l'inférence en direct en alimentant le pipeline au fil de l'arrivée des données.

    Motif de la recommandation :L'article détaille le chunking avec stride pour Wav2Vec2, une méthode directement réutilisable pour l'ASR sur fichiers longs et en direct.

8 décembremer.
19 janviermar.
  1. Hugging Face Blog62

    Comment entraîner plus vite et plus gros avec ZeRO via DeepSpeed et FairScale

    Le blog Hugging Face détaille l'intégration expérimentale de ZeRO de DeepSpeed et FairScale dans le Trainer de transformers à partir de la v4.2.0.

    Motif de la recommandation :L'article compare les gains de ZeRO via DeepSpeed et FairScale sur t5-large et t5-3b, avec des chiffres de temps et de batch size directement réutilisables.