Aller au contenu
30 janviermar.
25 janvierjeu.
  1. Hugging Face Blog40

    Hugging Face et Google Cloud annoncent un partenariat stratégique pour l'IA ouverte

    Hugging Face et Google Cloud ont annoncé un partenariat stratégique pour démocratiser le machine learning et permettre aux entreprises de construire leur propre IA avec des modèles ouverts. Les clients de Google Cloud pourront entraîner et déployer les modèles Hugging Face via Google Kubernetes Engine (GKE) et Vertex AI, en s'appuyant sur les TPU, les VM A3 équipées de GPU NVIDIA H100 Tensor Core et les VM C3. Les utilisateurs du Hugging Face Hub bénéficieront du déploiement en production via Inference Endpoints et de l'accélération par TPU sur Hugging Face Spaces, avec des annonces prévues dès ce trimestre.

15 janvierlun.
14 janvierdim.
  1. Hugging Face Blog62

    Exécuter gratuitement des workflows ComfyUI avec Gradio sur Hugging Face Spaces

    Hugging Face publie un tutoriel pas à pas pour convertir un workflow ComfyUI en application Gradio et la déployer gratuitement sur Hugging Face Spaces via ZeroGPU. Le processus passe par l'extension ComfyUI-to-Python-Extension pour exporter le workflow en script Python, puis par la création d'une interface Gradio exposant prompt, image de structure, image de style et forces associées. Les modèles sont téléchargés depuis le Hub via hf_hub_download et préchargés hors de la fonction décorée par @spaces.GPU pour tirer parti du serverless. L'auteur indique qu'une automatisation complète du processus est prévue début 2025.

    Motif de la recommandation :Un guide pas à pas pour transformer un workflow ComfyUI en application Gradio et l'héberger gratuitement sur ZeroGPU.

12 janvierven.
10 janviermer.
  1. Hugging Face Blog62

    Unsloth et TRL : fine-tuning LLM 2x plus rapide

    Unsloth, une bibliothèque légère développée par la communauté, accélère le fine-tuning des LLM jusqu'à 2x et réduit l'usage de mémoire jusqu'à 74% sans dégradation de précision.

    Motif de la recommandation :L'article détaille les gains de vitesse et de mémoire d'Unsloth pour le fine-tuning, avec des benchmarks reproductibles et un exemple d'intégration à TRL.

20 décembremer.
  1. Hugging Face Blog60

    Décodage spéculatif pour une inférence Whisper 2x plus rapide

    Le blog Hugging Face montre comment le décodage spéculatif, implémenté comme stratégie « assisted generation » dans Transformers.

    Motif de la recommandation :L'article détaille l'implémentation du décodage spéculatif dans Transformers avec des benchmarks reproductibles, permettant de réduire de moitié le temps d'inférence de Whisper sans perte de précision.

11 décembrelun.
  1. Mistral AI88

    Mistral AI publie Mixtral 8x7B, un modèle MoE à poids ouverts

    Mistral AI publie Mixtral 8x7B, un modèle à mélange d'experts clairsemé (SMoE) à poids ouverts sous licence Apache 2.0. Il surpasse Llama 2 70B sur la plupart des benchmarks avec une inférence 6 fois plus rapide, égale ou dépasse GPT3.5 sur la plupart des benchmarks standards, gère un contexte de 32k tokens et maîtrise l'anglais, le français, l'italien, l'allemand et l'espagnol. Le modèle compte 46,7B paramètres au total mais n'en utilise que 12,9B par token, et Mixtral 8x7B Instruct atteint 8,30 sur MT-Bench. Mistral AI a soumis des modifications à vLLM intégrant les kernels CUDA Megablocks, et Skypilot permet le déploiement des endpoints vLLM sur n'importe quelle instance cloud.

    Motif de la recommandation :L'original expose l'architecture MoE, les performances comparées et la pile de déploiement open source, ce qui permet de juger le compromis coût/performance.

  2. Mistral AI78

    Mistral AI ouvre l'accès bêta à la plateforme avec trois endpoints de chat et un endpoint d'embedding

    Mistral AI ouvre l'accès bêta à sa première plateforme, la plateforme, qui propose trois endpoints de chat et un endpoint d'embedding. mistral-tiny sert Mistral 7B Instruct v0.2.

    Motif de la recommandation :L'original expose les trois endpoints de chat et l'endpoint d'embedding, leurs modèles sous-jacents et leurs scores MT-Bench, ce qui permet de comparer le compromis performance/prix avant intégration.

  3. Hugging Face Blog85

    Hugging Face intègre Mixtral 8x7B, un modèle MoE open source SOTA

    Mistral a publié Mixtral 8x7B, un modèle à mélange d'experts (MoE) qui établit un nouveau niveau SOTA pour les modèles open access et surpasse GPT-3.5 sur de nombreux benchmarks. Hugging Face annonce son intégration complète dans son écosystème : modèles sur le Hub sous licence Apache 2.0, support dans Transformers, Inference Endpoints, Text Generation Inference, et un exemple de fine-tuning sur un seul GPU avec TRL. Le modèle supporte une fenêtre de contexte de 32k tokens, parle anglais, français, allemand, espagnol et italien, et obtient 40,2 % sur HumanEval. Mixtral Instruct dépasse tous les autres modèles open access sur MT-Bench avec un score de 8,30, comparable à GPT-3.5.

    Motif de la recommandation :L'article détaille l'intégration complète de Mixtral 8x7B dans l'écosystème Hugging Face, des points de déploiement à la quantification, utile pour évaluer les options d'inférence et de fine-tuning.

  4. Hugging Face Blog60

    Mixture of Experts expliqué : briques, entraînement et compromis de service

    Hugging Face publie une explication des Mixture of Experts (MoE), architecture mise en avant par la sortie de Mixtral 8x7B. L'article décrit les deux composants d'une couche MoE.

    Motif de la recommandation :L'article détaille les briques, l'entraînement et les compromis de service des MoE, utile pour comprendre l'architecture derrière Mixtral 8x7B.

5 décembremar.
  1. Hugging Face Blog62

    Hugging Face lance Optimum-NVIDIA, une bibliothèque d'inférence LLM accélérée en une ligne de code

    Hugging Face publie Optimum-NVIDIA, une bibliothèque d'inférence qui accélère l'inférence des LLM sur la plateforme NVIDIA en modifiant une seule ligne de code.

    Motif de la recommandation :L'original expose le point d'entrée d'une ligne, le gain de débit et la prise en charge de FP8, ce qui permet de juger l'impact sur le déploiement existant.

  2. Hugging Face Blog62

    Hugging Face : comment accélérer l'inférence LoRA de 300 % en gardant le modèle de base chaud

    Hugging Face a réduit le temps de démarrage à froid de l'inférence LoRA de 25 s à 3 s et le temps de réponse de 35 s à 13 s en gardant le modèle de base Stable Diffusion XL chargé et en échangeant les adaptateurs LoRA à la demande. Le Hub héberge environ 2500 LoRA publics, dont environ 92 % reposent sur Stable Diffusion XL Base 1.0, et cette mutualisation permet de servir des centaines de LoRA distincts avec moins de 5 GPU A10G. L'article détaille l'implémentation dans Diffusers avec load_lora_weights, fuse_lora, unload_lora_weights et unfuse_lora, ainsi que les temps de chargement et d'inférence mesurés sur T4 et A10G.

    Motif de la recommandation :L'article détaille le mécanisme de mutualisation des adaptateurs LoRA et les gains mesurés, utile pour ceux qui déploient plusieurs modèles fine-tunés.

7 novembremar.
27 octobreven.
  1. Hugging Face Blog62

    Personal Copilot : entraîner son propre assistant de codage avec StarCoder

    Hugging Face présente HugCoder, un LLM de code fine-tuné sur les dépôts publics de l'organisation Hugging Face.

    Motif de la recommandation :L'article détaille le workflow complet de collecte de données, de fine-tuning QLoRA et de déploiement local d'un copilote de code, avec des scripts et des configurations réutilisables.

24 octobremar.
  1. Hugging Face Blog52

    Les N détails d'implémentation du RLHF avec PPO

    Hugging Face publie une reproduction du codebase RLHF original d'OpenAI (openai/lm-human-preferences) et détaille les détails d'implémentation nécessaires pour reproduire ses courbes d'apprentissage sur des tâches stylistiques. Le codebase de reproduction (https://github.com/vwxyzjn/lm-human-preference-details) atteint des courbes quasi identiques à celles d'OpenAI, avec un espace de démonstration et les logs d'entraînement disponibles. L'article identifie une différence entre l'optimiseur Adam de PyTorch et celui de TensorFlow : PyTorch utilise un terme de normalisation plus petit en début d'entraînement, ce qui provoque des mises à jour de gradient plus agressives et affecte davantage les grands modèles comme gpt2-xl.

19 octobrejeu.
  1. Hugging Face Blog60

    Gradio-Lite : exécuter Gradio entièrement dans le navigateur sans serveur

    Hugging Face publie @gradio/lite, une bibliothèque JavaScript qui s'appuie sur Pyodide pour exécuter des applications Gradio directement dans le navigateur.

    Motif de la recommandation :Présente le fonctionnement sans serveur de Gradio dans le navigateur et ses limites de chargement, utile pour évaluer les options de déploiement.

4 octobremer.
2 octobrelun.
26 septembremar.
  1. Hugging Face Blog32

    Llama 2 sur Amazon SageMaker : un benchmark

    Hugging Face a publié un benchmark de plus de 60 configurations de déploiement de Llama 2 sur Amazon SageMaker avec le Hugging Face LLM Inference Container. Les tests couvrent les tailles 7B, 13B et 70B sur des instances g5.2xlarge, g5.12xlarge, g5.48xlarge (NVIDIA A10G) et p4d.24xlarge (NVIDIA A100 40GB), avec 1, 5, 10 et 20 requêtes simultanées, en comparant notamment la quantification GPTQ 4-bit. Les recommandations distinguent le déploiement le plus économique, le meilleur débit et la meilleure latence ; le code, les données brutes et le tableur sont publiés sur GitHub.

19 septembremar.
15 septembreven.
13 septembremer.
12 septembremar.
11 septembrelun.
1 septembreven.
30 aoûtmer.
25 aoûtven.
  1. Hugging Face Blog88

    Code Llama : Llama 2 apprend à coder

    Hugging Face annonce l'intégration de Code Llama, une famille de modèles ouverts dérivés de Llama 2 spécialisés sur le code.

    Motif de la recommandation :Présente les trois tailles de Code Llama, la fenêtre de contexte étendue et l'intégration complète dans l'écosystème Hugging Face.

23 aoûtmer.
22 aoûtmar.
10 aoûtjeu.
9 aoûtmer.
8 aoûtmar.
  1. Hugging Face Blog62

    Fine-tuner Llama 2 avec DPO dans la bibliothèque TRL

    Hugging Face présente l'implémentation de la méthode Direct Preference Optimization (DPO) dans la bibliothèque TRL et montre comment fine-tuner le modèle Llama 2 7B sur le jeu de données de préférences Stack Exchange. DPO remplace l'étape de modélisation de récompense et l'optimisation RL de RLHF par un objectif de vraisemblance directe optimisé via une simple perte d'entropie croisée binaire, en s'appuyant sur une correspondance analytique entre la fonction de récompense et la politique RL optimale. Le tutoriel détaille le pipeline complet : SFT avec QLoRA sur Llama 2 7B, préparation des données de préférence au format prompt/chosen/rejected, puis entraînement avec DPOTrainer en configurant le paramètre beta (0,1 à 0,5). Le code source des scripts d'entraînement est disponible dans le répertoire examples/stack_llama_2 et le modèle entraîné est publié sur le Hub Hugging Face.

    Motif de la recommandation :Le tutoriel détaille l'implémentation de DPO dans TRL et le fine-tuning de Llama 2, avec le code et les métriques de suivi.

4 aoûtven.
2 aoûtmer.
18 juilletmar.
  1. Hugging Face Blog88

    Llama 2 est disponible sur Hugging Face

    Meta publie Llama 2, une famille de grands modèles de langage open access de 7B à 70B paramètres.

    Motif de la recommandation :Présente l'intégration complète de Llama 2 dans Hugging Face, avec les modèles, l'inférence et le fine-tuning, utile pour évaluer les options de déploiement.