Aller au contenu
5 décembremar.
  1. Hugging Face Blog62

    Hugging Face lance Optimum-NVIDIA, une bibliothèque d'inférence LLM accélérée en une ligne de code

    Hugging Face publie Optimum-NVIDIA, une bibliothèque d'inférence qui accélère l'inférence des LLM sur la plateforme NVIDIA en modifiant une seule ligne de code.

    Motif de la recommandation :L'original expose le point d'entrée d'une ligne, le gain de débit et la prise en charge de FP8, ce qui permet de juger l'impact sur le déploiement existant.

  2. Hugging Face Blog62

    Hugging Face : comment accélérer l'inférence LoRA de 300 % en gardant le modèle de base chaud

    Hugging Face a réduit le temps de démarrage à froid de l'inférence LoRA de 25 s à 3 s et le temps de réponse de 35 s à 13 s en gardant le modèle de base Stable Diffusion XL chargé et en échangeant les adaptateurs LoRA à la demande. Le Hub héberge environ 2500 LoRA publics, dont environ 92 % reposent sur Stable Diffusion XL Base 1.0, et cette mutualisation permet de servir des centaines de LoRA distincts avec moins de 5 GPU A10G. L'article détaille l'implémentation dans Diffusers avec load_lora_weights, fuse_lora, unload_lora_weights et unfuse_lora, ainsi que les temps de chargement et d'inférence mesurés sur T4 et A10G.

    Motif de la recommandation :L'article détaille le mécanisme de mutualisation des adaptateurs LoRA et les gains mesurés, utile pour ceux qui déploient plusieurs modèles fine-tunés.

1 décembreven.
  1. Hugging Face Blog52

    Open LLM Leaderboard retire le benchmark DROP après avoir identifié des erreurs de notation

    Hugging Face a retiré le benchmark DROP de l'Open LLM Leaderboard après avoir constaté que la majorité des modèles obtenaient un f1-score inférieur à 10 sur 100. L'enquête a révélé que la normalisation ignorait les réponses numériques suivies d'un espace autre qu'un espace simple, et que l'utilisation du point comme token d'arrêt interrompait les réponses à virgule flottante et pénalisait les modèles générant de longues réponses. Une réexécution complète coûtant 8 années de temps GPU, l'équipe a décidé de retirer DROP jusqu'à ce qu'une nouvelle version corrige le scoring et la normalisation.

9 novembrejeu.
7 novembremar.
27 octobreven.
  1. Hugging Face Blog62

    Personal Copilot : entraîner son propre assistant de codage avec StarCoder

    Hugging Face présente HugCoder, un LLM de code fine-tuné sur les dépôts publics de l'organisation Hugging Face.

    Motif de la recommandation :L'article détaille le workflow complet de collecte de données, de fine-tuning QLoRA et de déploiement local d'un copilote de code, avec des scripts et des configurations réutilisables.

25 octobremer.
24 octobremar.
  1. Hugging Face Blog52

    Les N détails d'implémentation du RLHF avec PPO

    Hugging Face publie une reproduction du codebase RLHF original d'OpenAI (openai/lm-human-preferences) et détaille les détails d'implémentation nécessaires pour reproduire ses courbes d'apprentissage sur des tâches stylistiques. Le codebase de reproduction (https://github.com/vwxyzjn/lm-human-preference-details) atteint des courbes quasi identiques à celles d'OpenAI, avec un espace de démonstration et les logs d'entraînement disponibles. L'article identifie une différence entre l'optimiseur Adam de PyTorch et celui de TensorFlow : PyTorch utilise un terme de normalisation plus petit en début d'entraînement, ce qui provoque des mises à jour de gradient plus agressives et affecte davantage les grands modèles comme gpt2-xl.

19 octobrejeu.
  1. Hugging Face Blog60

    Gradio-Lite : exécuter Gradio entièrement dans le navigateur sans serveur

    Hugging Face publie @gradio/lite, une bibliothèque JavaScript qui s'appuie sur Pyodide pour exécuter des applications Gradio directement dans le navigateur.

    Motif de la recommandation :Présente le fonctionnement sans serveur de Gradio dans le navigateur et ses limites de chargement, utile pour évaluer les options de déploiement.

4 octobremer.
3 octobremar.
2 octobrelun.
29 septembreven.
  1. Hugging Face Blog62

    Fine-tuner Stable Diffusion avec DDPO via TRL

    Le blog Hugging Face présente DDPOTrainer, un nouvel outil de la bibliothèque TRL permettant de fine-tuner des modèles de diffusion comme Stable Diffusion par apprentissage par renforcement. DDPO modélise le processus de débruitage comme un processus de décision markovien et utilise PPO pour optimiser une fonction de récompense, par exemple un prédicteur esthétique entraîné sur le jeu de données AVA. L'article détaille l'installation (pip install trl[diffusers]), le script d'exemple ddpo.py, les hyperparamètres recommandés pour un entraînement sur GPU unique (200 époques, train_batch_size 3, learning rate 3e-4) et les limites actuelles, notamment la restriction aux modèles SD vanilla et la difficulté de trouver les bons hyperparamètres sans LoRA.

    Motif de la recommandation :L'article détaille l'intégration de DDPO dans la bibliothèque TRL et fournit les hyperparamètres recommandés pour le fine-tuning de Stable Diffusion.

28 septembrejeu.
27 septembremer.
26 septembremar.
  1. Hugging Face Blog32

    Llama 2 sur Amazon SageMaker : un benchmark

    Hugging Face a publié un benchmark de plus de 60 configurations de déploiement de Llama 2 sur Amazon SageMaker avec le Hugging Face LLM Inference Container. Les tests couvrent les tailles 7B, 13B et 70B sur des instances g5.2xlarge, g5.12xlarge, g5.48xlarge (NVIDIA A10G) et p4d.24xlarge (NVIDIA A100 40GB), avec 1, 5, 10 et 20 requêtes simultanées, en comparant notamment la quantification GPTQ 4-bit. Les recommandations distinguent le déploiement le plus économique, le meilleur débit et la meilleure latence ; le code, les données brutes et le tableur sont publiés sur GitHub.

22 septembreven.
19 septembremar.
18 septembrelun.
  1. Hugging Face Blog62

    Introduction au 3D Gaussian Splatting : principe, entraînement et perspectives graphiques

    Le 3D Gaussian Splatting est une technique de rastérisation décrite dans l'article 3D Gaussian Splatting for Real-Time Radiance Field Rendering.

    Motif de la recommandation :Décompose le principe, l'entraînement et les limites du 3D Gaussian Splatting, avec des repères concrets sur le VRAM et les visionneuses existantes.

15 septembreven.
13 septembremer.
  1. Hugging Face Blog72

    Würstchen : un modèle de diffusion rapide pour la génération d'images

    Hugging Face présente Würstchen, un modèle de diffusion texte-image qui atteint une compression spatiale de 42x grâce à une architecture en trois étapes (VQGAN.

    Motif de la recommandation :Le modèle atteint une compression spatiale 42x et un coût d'entraînement réduit, avec une intégration Diffusers directement réutilisable.

12 septembremar.
11 septembrelun.
8 septembreven.
  1. Hugging Face Blog62

    Génération contrôlable efficace pour SDXL avec T2I-Adapters

    L'équipe Diffusers et les auteurs de T2I-Adapter ont collaboré pour intégrer le support des T2I-Adapters pour Stable Diffusion XL (SDXL) dans diffusers. T2I-Adapter-SDXL ne pèse que 79 M de paramètres (158 Mo en fp16), soit une réduction de 93,69 % par rapport à ControlNet-SDXL (1251 M, 2,5 Go), et n'est exécuté qu'une seule fois pendant tout le processus de débruitage. Les points de contrôle entraînés sur 3M d'images LAION-Aesthetics V2 sont disponibles pour les conditions sketch, canny, lineart, depth et openpose, avec un script d'entraînement et un exemple d'utilisation via StableDiffusionXLAdapterPipeline.

    Motif de la recommandation :L'article détaille l'entraînement et l'usage des T2I-Adapters pour SDXL, avec des scripts et des points de contrôle ouverts, permettant de reproduire et de contrôler la génération d'images.

6 septembremer.
  1. Hugging Face Blog83

    Hugging Face accueille Falcon 180B, le plus grand modèle ouvert avec 180 milliards de paramètres

    Le Falcon 180B de TII rejoint Hugging Face Hub, avec 180 milliards de paramètres entraînés sur 3.

    Motif de la recommandation :Falcon 180B est le plus grand modèle ouvert à sa sortie, avec 180B paramètres et 3,5T tokens d'entraînement, ce qui permet de situer les capacités des modèles ouverts face aux modèles propriétaires.

1 septembreven.
30 aoûtmer.
25 aoûtven.
  1. Hugging Face Blog88

    Code Llama : Llama 2 apprend à coder

    Hugging Face annonce l'intégration de Code Llama, une famille de modèles ouverts dérivés de Llama 2 spécialisés sur le code.

    Motif de la recommandation :Présente les trois tailles de Code Llama, la fenêtre de contexte étendue et l'intégration complète dans l'écosystème Hugging Face.

23 aoûtmer.
22 aoûtmar.
10 aoûtjeu.
9 aoûtmer.