Aller au contenu
4 marslun.
29 févrierjeu.
28 févriermer.
  1. Hugging Face Blog78

    BigCode publie StarCoder2 et The Stack v2

    BigCode publie StarCoder2, une famille de LLM ouverts pour le code en trois tailles de 3B.

    Motif de la recommandation :Présente les trois tailles de StarCoder2, la taille des données d'entraînement et la divulgation complète des modèles, jeux de données et code d'entraînement.

27 févriermar.
26 févrierlun.
23 févrierven.
21 févriermer.
20 févriermar.
19 févrierlun.
16 févrierven.
  1. Hugging Face Blog73

    Hugging Face : générer des données synthétiques avec un LLM open source pour entraîner un modèle spécialisé

    Hugging Face détaille une méthode pour créer des données synthétiques avec le LLM open source Mixtral-8x7B-Instruct-v0.1 afin d'entraîner un petit modèle spécialisé.

    Motif de la recommandation :Un cas concret de distillation par données synthétiques avec coûts, latence et émissions comparés à GPT-4, et des notebooks réutilisables.

14 févriermer.
8 févrierjeu.
  1. Hugging Face Blog62

    Hugging Face ajoute Messages API compatible OpenAI à TGI et Inference Endpoints

    Hugging Face introduit Messages API, qui apporte la compatibilité avec l'API OpenAI Chat Completion à Text Generation Inference (TGI) et Inference Endpoints à partir de la version 1.4.0 de TGI. L'API peut être utilisée directement avec les bibliothèques clientes d'OpenAI ou des outils tiers comme LangChain et LlamaIndex, et elle est disponible sur Inference Endpoints en versions dédiée et serverless. Elle ne prend pas encore en charge le function calling et ne fonctionne qu'avec les LLM disposant d'un chat_template défini dans la configuration de leur tokenizer, comme Mixtral 8x7B Instruct.

    Motif de la recommandation :L'original détaille la compatibilité OpenAI de TGI et les étapes de migration, ce qui aide le lecteur à évaluer le coût de bascule vers des LLM ouverts.

3 févriersam.
  1. Hugging Face Blog62

    SegMoE : un framework pour créer des modèles de diffusion Mixture-of-Experts

    SegMoE est un framework permettant de créer des modèles de diffusion Mixture-of-Experts à partir de modèles pré-entraînés.

    Motif de la recommandation :SegMoE permet de créer des modèles de diffusion Mixture-of-Experts à partir de modèles pré-entraînés, avec un package et une intégration diffusers directement réutilisables.

2 févrierven.
1 févrierjeu.
31 janviermer.
30 janviermar.
29 janvierlun.
26 janvierven.
25 janvierjeu.
  1. Hugging Face Blog40

    Hugging Face et Google Cloud annoncent un partenariat stratégique pour l'IA ouverte

    Hugging Face et Google Cloud ont annoncé un partenariat stratégique pour démocratiser le machine learning et permettre aux entreprises de construire leur propre IA avec des modèles ouverts. Les clients de Google Cloud pourront entraîner et déployer les modèles Hugging Face via Google Kubernetes Engine (GKE) et Vertex AI, en s'appuyant sur les TPU, les VM A3 équipées de GPU NVIDIA H100 Tensor Core et les VM C3. Les utilisateurs du Hugging Face Hub bénéficieront du déploiement en production via Inference Endpoints et de l'accélération par TPU sur Hugging Face Spaces, avec des annonces prévues dès ce trimestre.

24 janviermer.
19 janvierven.
18 janvierjeu.
15 janvierlun.
14 janvierdim.
  1. Hugging Face Blog62

    Exécuter gratuitement des workflows ComfyUI avec Gradio sur Hugging Face Spaces

    Hugging Face publie un tutoriel pas à pas pour convertir un workflow ComfyUI en application Gradio et la déployer gratuitement sur Hugging Face Spaces via ZeroGPU. Le processus passe par l'extension ComfyUI-to-Python-Extension pour exporter le workflow en script Python, puis par la création d'une interface Gradio exposant prompt, image de structure, image de style et forces associées. Les modèles sont téléchargés depuis le Hub via hf_hub_download et préchargés hors de la fonction décorée par @spaces.GPU pour tirer parti du serverless. L'auteur indique qu'une automatisation complète du processus est prévue début 2025.

    Motif de la recommandation :Un guide pas à pas pour transformer un workflow ComfyUI en application Gradio et l'héberger gratuitement sur ZeroGPU.

12 janvierven.
10 janviermer.
  1. Hugging Face Blog62

    Unsloth et TRL : fine-tuning LLM 2x plus rapide

    Unsloth, une bibliothèque légère développée par la communauté, accélère le fine-tuning des LLM jusqu'à 2x et réduit l'usage de mémoire jusqu'à 74% sans dégradation de précision.

    Motif de la recommandation :L'article détaille les gains de vitesse et de mémoire d'Unsloth pour le fine-tuning, avec des benchmarks reproductibles et un exemple d'intégration à TRL.

4 janvierjeu.
  1. Hugging Face Blog62

    Hugging Face publie aMUSEd, un modèle de génération d'images texte-image non-diffusion

    Hugging Face a publié aMUSEd, un modèle de génération d'images texte-image efficace non-diffusion.

    Motif de la recommandation :aMUSEd adopte une méthode non-diffusion MIM, avec un poids d'environ 800M et une inférence rapide, et fournit un code d'entraînement et de fine-tuning, ce qui permet de comprendre la voie de génération d'images sans diffusion.

2 janviermar.
20 décembremer.
  1. Hugging Face Blog60

    Décodage spéculatif pour une inférence Whisper 2x plus rapide

    Le blog Hugging Face montre comment le décodage spéculatif, implémenté comme stratégie « assisted generation » dans Transformers.

    Motif de la recommandation :L'article détaille l'implémentation du décodage spéculatif dans Transformers avec des benchmarks reproductibles, permettant de réduire de moitié le temps d'inférence de Whisper sans perte de précision.

18 décembrelun.
11 décembrelun.
  1. Hugging Face Blog85

    Hugging Face intègre Mixtral 8x7B, un modèle MoE open source SOTA

    Mistral a publié Mixtral 8x7B, un modèle à mélange d'experts (MoE) qui établit un nouveau niveau SOTA pour les modèles open access et surpasse GPT-3.5 sur de nombreux benchmarks. Hugging Face annonce son intégration complète dans son écosystème : modèles sur le Hub sous licence Apache 2.0, support dans Transformers, Inference Endpoints, Text Generation Inference, et un exemple de fine-tuning sur un seul GPU avec TRL. Le modèle supporte une fenêtre de contexte de 32k tokens, parle anglais, français, allemand, espagnol et italien, et obtient 40,2 % sur HumanEval. Mixtral Instruct dépasse tous les autres modèles open access sur MT-Bench avec un score de 8,30, comparable à GPT-3.5.

    Motif de la recommandation :L'article détaille l'intégration complète de Mixtral 8x7B dans l'écosystème Hugging Face, des points de déploiement à la quantification, utile pour évaluer les options d'inférence et de fine-tuning.

  2. Hugging Face Blog60

    Mixture of Experts expliqué : briques, entraînement et compromis de service

    Hugging Face publie une explication des Mixture of Experts (MoE), architecture mise en avant par la sortie de Mixtral 8x7B. L'article décrit les deux composants d'une couche MoE.

    Motif de la recommandation :L'article détaille les briques, l'entraînement et les compromis de service des MoE, utile pour comprendre l'architecture derrière Mixtral 8x7B.

6 décembremer.
5 décembremar.