Aller au contenu

Orientations techniques

Déploiement et ingénierie Dernières actualités

Les pratiques d'ingénierie pour faire tourner les modèles : optimisation de l'inférence, mémoire GPU et coûts, architectures de serving et choix d'infrastructure.

175 sélections30 derniers jours 25 entréesTotal : 483 entrées

mise à jour

Archives de la sélection · page 7

12 aoûtlun.121–140 entrées
  1. Hugging Face Blog62

    Hugging Face lance une API unifiée d'appel d'outils pour plusieurs familles de modèles

    Hugging Face annonce une API unifiée d'appel d'outils couvrant plusieurs familles de modèles populaires.

    Motif de la recommandation :L'API unifiée d'appel d'outils et les templates de chat permettent de porter le même code entre Mistral, Cohere, NousResearch et Llama, ce qui réduit le travail d'adaptation par modèle.

7 aoûtmer.
  1. Mistral AI60

    Mistral AI annonce la personnalisation de modèles, les Agents en alpha et le SDK mistralai 1.0

    Mistral AI annonce la possibilité de personnaliser n'importe lequel de ses modèles phares et spécialisés sur La Plateforme.

    Motif de la recommandation :Mistral AI expose en détail la personnalisation de modèles, les Agents en alpha et le SDK 1.0, ce qui permet de juger des changements concrets pour les développeurs.

30 juilletmar.
  1. Hugging Face Blog60

    Comment réduire la mémoire des Diffusion Transformers avec Quanto et Diffusers

    Hugging Face présente comment quantifier les pipelines de diffusion basés sur Transformer avec les utilitaires Quanto de la bibliothèque Diffusers.

    Motif de la recommandation :L'article détaille les gains de mémoire mesurés sur trois pipelines de diffusion Transformer avec Quanto, avec des tableaux de latence et de qualité.

23 juilletmar.
18 juilletjeu.
  1. Mistral AI78

    Mistral AI publie Mistral NeMo, un modèle 12B avec une fenêtre de contexte de 128k

    Mistral AI publie Mistral NeMo, un modèle 12B développé en collaboration avec NVIDIA.

    Motif de la recommandation :Mistral NeMo est un modèle 12B à fenêtre de 128k, sous licence Apache 2.0, avec un tokenizer Tekken plus efficace et une quantification FP8, ce qui permet d'évaluer les compromis entre taille, contexte et coût d'inférence.

10 juilletmer.
  1. Hugging Face Blog60

    Hugging Face et KerasHub annoncent une intégration : les modèles Transformers peuvent être chargés directement dans KerasHub

    Hugging Face et KerasHub annoncent une intégration : Transformers et KerasHub partagent désormais un format de sauvegarde de modèles.

    Motif de la recommandation :L'original expose le format de sauvegarde partagé entre Transformers et KerasHub, ce qui permet de charger directement plus de 300 000 modèles fine-tunés dans KerasHub.

27 juinjeu.
12 juinmer.
5 juinmer.
18 avriljeu.
  1. Hugging Face Blog88

    Meta publie Llama 3, la nouvelle génération de LLM open source

    Meta publie Llama 3, la nouvelle génération de sa famille de LLM open source, disponible sur Hugging Face en versions 8B et 70B.

    Motif de la recommandation :L'article détaille les spécifications de Llama 3, les intégrations dans l'écosystème Hugging Face et les méthodes de déploiement, ce qui permet de comprendre les capacités du modèle et les options d'utilisation.

22 marsven.
  1. Hugging Face Blog62

    Hugging Face : quantification binaire et scalaire des embeddings pour un retrieval plus rapide et moins coûteux

    Hugging Face présente la quantification des embeddings comme une étape de post-traitement qui réduit la mémoire et le stockage sans réduire la dimensionnalité. La quantification binaire convertit les valeurs float32 en 1 bit, soit une réduction de 32x, et permet de conserver environ 96 % des performances de retrieval grâce à une étape de rescoring avec l'embedding de requête float32 ; la quantification scalaire en int8 réduit la taille de 4x et atteint environ 99 % des performances avec un rescore_multiplier de 4 à 5. Sur un benchmark MTEB Retrieval, la quantification binaire offre un gain de vitesse moyen de 24,76x et la quantification int8 de 3,66x. Une démo combine recherche binaire et rescoring int8 sur 41 millions de textes Wikipédia, avec 5,2 Go de mémoire et 52 Go d'espace disque contre 200 Go pour un retrieval float32 classique. Le code est disponible via Sentence Transformers et des scripts d'exemple.

    Motif de la recommandation :L'article détaille les principes et le code de la quantification binaire et scalaire des embeddings, avec des gains de vitesse et de coût mesurés sur 41 millions de textes.

20 marsmer.
  1. Hugging Face Blog62

    GaLore : entraîner de grands modèles sur du matériel grand public

    Le blog Hugging Face présente GaLore, une méthode qui projette les gradients dans un sous-espace de bas rang pour réduire la mémoire des états d'optimiseur de plus de 82.

    Motif de la recommandation :L'article détaille la réduction de plus de 82,5 % de la mémoire des états d'optimiseur et fournit un exemple exécutable avec transformers, utile pour l'entraînement sur GPU grand public.

26 févrierlun.
21 févriermer.
16 févrierven.
  1. Hugging Face Blog73

    Hugging Face : générer des données synthétiques avec un LLM open source pour entraîner un modèle spécialisé

    Hugging Face détaille une méthode pour créer des données synthétiques avec le LLM open source Mixtral-8x7B-Instruct-v0.1 afin d'entraîner un petit modèle spécialisé.

    Motif de la recommandation :Un cas concret de distillation par données synthétiques avec coûts, latence et émissions comparés à GPT-4, et des notebooks réutilisables.

8 févrierjeu.
  1. Hugging Face Blog62

    Hugging Face ajoute Messages API compatible OpenAI à TGI et Inference Endpoints

    Hugging Face introduit Messages API, qui apporte la compatibilité avec l'API OpenAI Chat Completion à Text Generation Inference (TGI) et Inference Endpoints à partir de la version 1.4.0 de TGI. L'API peut être utilisée directement avec les bibliothèques clientes d'OpenAI ou des outils tiers comme LangChain et LlamaIndex, et elle est disponible sur Inference Endpoints en versions dédiée et serverless. Elle ne prend pas encore en charge le function calling et ne fonctionne qu'avec les LLM disposant d'un chat_template défini dans la configuration de leur tokenizer, comme Mixtral 8x7B Instruct.

    Motif de la recommandation :L'original détaille la compatibilité OpenAI de TGI et les étapes de migration, ce qui aide le lecteur à évaluer le coût de bascule vers des LLM ouverts.

14 janvierdim.
  1. Hugging Face Blog62

    Exécuter gratuitement des workflows ComfyUI avec Gradio sur Hugging Face Spaces

    Hugging Face publie un tutoriel pas à pas pour convertir un workflow ComfyUI en application Gradio et la déployer gratuitement sur Hugging Face Spaces via ZeroGPU. Le processus passe par l'extension ComfyUI-to-Python-Extension pour exporter le workflow en script Python, puis par la création d'une interface Gradio exposant prompt, image de structure, image de style et forces associées. Les modèles sont téléchargés depuis le Hub via hf_hub_download et préchargés hors de la fonction décorée par @spaces.GPU pour tirer parti du serverless. L'auteur indique qu'une automatisation complète du processus est prévue début 2025.

    Motif de la recommandation :Un guide pas à pas pour transformer un workflow ComfyUI en application Gradio et l'héberger gratuitement sur ZeroGPU.

10 janviermer.
  1. Hugging Face Blog62

    Unsloth et TRL : fine-tuning LLM 2x plus rapide

    Unsloth, une bibliothèque légère développée par la communauté, accélère le fine-tuning des LLM jusqu'à 2x et réduit l'usage de mémoire jusqu'à 74% sans dégradation de précision.

    Motif de la recommandation :L'article détaille les gains de vitesse et de mémoire d'Unsloth pour le fine-tuning, avec des benchmarks reproductibles et un exemple d'intégration à TRL.

20 décembremer.
  1. Hugging Face Blog60

    Décodage spéculatif pour une inférence Whisper 2x plus rapide

    Le blog Hugging Face montre comment le décodage spéculatif, implémenté comme stratégie « assisted generation » dans Transformers.

    Motif de la recommandation :L'article détaille l'implémentation du décodage spéculatif dans Transformers avec des benchmarks reproductibles, permettant de réduire de moitié le temps d'inférence de Whisper sans perte de précision.