Pipeline de génération de texte sur l'accélérateur Intel® Gaudi® 2
Hugging Face détaille un pipeline de génération de texte pour les modèles Llama 2 (7b.
Hugging Face détaille un pipeline de génération de texte pour les modèles Llama 2 (7b.
Mistral AI publie Mistral Large, son nouveau modèle phare de génération de texte.
Motif de la recommandation :Mistral Large est présenté comme le deuxième modèle disponible via API derrière GPT-4, avec fenêtre de 32K et function calling, ce qui éclaire les choix de déploiement.
Hugging Face détaille le fine-tuning PEFT des modèles Gemma de Google DeepMind (2B et 7B.
Google a publié Gemma, une famille de quatre LLM ouverts disponibles en 2B et 7B paramètres.
Motif de la recommandation :L'article détaille l'intégration complète de Gemma dans l'écosystème Hugging Face, du déploiement à l'affinage, avec des exemples de code exécutables.
Hugging Face détaille une méthode pour créer des données synthétiques avec le LLM open source Mixtral-8x7B-Instruct-v0.1 afin d'entraîner un petit modèle spécialisé.
Motif de la recommandation :Un cas concret de distillation par données synthétiques avec coûts, latence et émissions comparés à GPT-4, et des notebooks réutilisables.
AMD lance le Pervasive AI Developer Contest, un concours mondial avec Hugging Face offrant 700 plateformes AMD et 160 000 USD de prix.
Hugging Face introduit Messages API, qui apporte la compatibilité avec l'API OpenAI Chat Completion à Text Generation Inference (TGI) et Inference Endpoints à partir de la version 1.4.0 de TGI. L'API peut être utilisée directement avec les bibliothèques clientes d'OpenAI ou des outils tiers comme LangChain et LlamaIndex, et elle est disponible sur Inference Endpoints en versions dédiée et serverless. Elle ne prend pas encore en charge le function calling et ne fonctionne qu'avec les LLM disposant d'un chat_template défini dans la configuration de leur tokenizer, comme Mixtral 8x7B Instruct.
Motif de la recommandation :L'original détaille la compatibilité OpenAI de TGI et les étapes de migration, ce qui aide le lecteur à évaluer le coût de bascule vers des LLM ouverts.
Hugging Face Text Generation Inference (TGI) est désormais généralement disponible sur AWS Inferentia2 et Amazon SageMaker.
Hugging Face détaille plus de 7x d'accélération de l'inférence du modèle StarCoder-15B sur les processeurs Intel Xeon de 4e génération.
Hugging Face et Google Cloud ont annoncé un partenariat stratégique pour démocratiser le machine learning et permettre aux entreprises de construire leur propre IA avec des modèles ouverts. Les clients de Google Cloud pourront entraîner et déployer les modèles Hugging Face via Google Kubernetes Engine (GKE) et Vertex AI, en s'appuyant sur les TPU, les VM A3 équipées de GPU NVIDIA H100 Tensor Core et les VM C3. Les utilisateurs du Hugging Face Hub bénéficieront du déploiement en production via Inference Endpoints et de l'accélération par TPU sur Hugging Face Spaces, avec des annonces prévues dès ce trimestre.
ONNX Runtime accélère l'inférence de SD Turbo et SDXL Turbo sur GPU NVIDIA.
Hugging Face publie un tutoriel pas à pas pour convertir un workflow ComfyUI en application Gradio et la déployer gratuitement sur Hugging Face Spaces via ZeroGPU. Le processus passe par l'extension ComfyUI-to-Python-Extension pour exporter le workflow en script Python, puis par la création d'une interface Gradio exposant prompt, image de structure, image de style et forces associées. Les modèles sont téléchargés depuis le Hub via hf_hub_download et préchargés hors de la fonction décorée par @spaces.GPU pour tirer parti du serverless. L'auteur indique qu'une automatisation complète du processus est prévue début 2025.
Motif de la recommandation :Un guide pas à pas pour transformer un workflow ComfyUI en application Gradio et l'héberger gratuitement sur ZeroGPU.
Vectara a mis en ligne le HHEM Leaderboard, un classement open source dédié à la mesure de la fréquence d'hallucination des LLM.
Unsloth, une bibliothèque légère développée par la communauté, accélère le fine-tuning des LLM jusqu'à 2x et réduit l'usage de mémoire jusqu'à 74% sans dégradation de précision.
Motif de la recommandation :L'article détaille les gains de vitesse et de mémoire d'Unsloth pour le fine-tuning, avec des benchmarks reproductibles et un exemple d'intégration à TRL.
WHOOP propose un coaching fitness et santé personnalisé alimenté par GPT-4. L'entreprise s'appuie sur ce modèle d'OpenAI pour délivrer des solutions de santé personnalisées à ses utilisateurs.
Le blog Hugging Face montre comment le décodage spéculatif, implémenté comme stratégie « assisted generation » dans Transformers.
Motif de la recommandation :L'article détaille l'implémentation du décodage spéculatif dans Transformers avec des benchmarks reproductibles, permettant de réduire de moitié le temps d'inférence de Whisper sans perte de précision.
Summer Health réimagine les visites pédiatriques avec OpenAI pour accroître la précision des notes de consultation. L'entreprise s'appuie sur les modèles d'OpenAI afin d'améliorer la qualité et la fiabilité de la documentation clinique lors des rendez-vous pédiatriques.
Mistral AI publie Mixtral 8x7B, un modèle à mélange d'experts clairsemé (SMoE) à poids ouverts sous licence Apache 2.0. Il surpasse Llama 2 70B sur la plupart des benchmarks avec une inférence 6 fois plus rapide, égale ou dépasse GPT3.5 sur la plupart des benchmarks standards, gère un contexte de 32k tokens et maîtrise l'anglais, le français, l'italien, l'allemand et l'espagnol. Le modèle compte 46,7B paramètres au total mais n'en utilise que 12,9B par token, et Mixtral 8x7B Instruct atteint 8,30 sur MT-Bench. Mistral AI a soumis des modifications à vLLM intégrant les kernels CUDA Megablocks, et Skypilot permet le déploiement des endpoints vLLM sur n'importe quelle instance cloud.
Motif de la recommandation :L'original expose l'architecture MoE, les performances comparées et la pile de déploiement open source, ce qui permet de juger le compromis coût/performance.
Mistral AI ouvre l'accès bêta à sa première plateforme, la plateforme, qui propose trois endpoints de chat et un endpoint d'embedding. mistral-tiny sert Mistral 7B Instruct v0.2.
Motif de la recommandation :L'original expose les trois endpoints de chat et l'endpoint d'embedding, leurs modèles sous-jacents et leurs scores MT-Bench, ce qui permet de comparer le compromis performance/prix avant intégration.
Mistral a publié Mixtral 8x7B, un modèle à mélange d'experts (MoE) qui établit un nouveau niveau SOTA pour les modèles open access et surpasse GPT-3.5 sur de nombreux benchmarks. Hugging Face annonce son intégration complète dans son écosystème : modèles sur le Hub sous licence Apache 2.0, support dans Transformers, Inference Endpoints, Text Generation Inference, et un exemple de fine-tuning sur un seul GPU avec TRL. Le modèle supporte une fenêtre de contexte de 32k tokens, parle anglais, français, allemand, espagnol et italien, et obtient 40,2 % sur HumanEval. Mixtral Instruct dépasse tous les autres modèles open access sur MT-Bench avec un score de 8,30, comparable à GPT-3.5.
Motif de la recommandation :L'article détaille l'intégration complète de Mixtral 8x7B dans l'écosystème Hugging Face, des points de déploiement à la quantification, utile pour évaluer les options d'inférence et de fine-tuning.
Hugging Face publie une explication des Mixture of Experts (MoE), architecture mise en avant par la sortie de Mixtral 8x7B. L'article décrit les deux composants d'une couche MoE.
Motif de la recommandation :L'article détaille les briques, l'entraînement et les compromis de service des MoE, utile pour comprendre l'architecture derrière Mixtral 8x7B.
Hugging Face et AMD annoncent que les modèles Transformers peuvent désormais tourner sans modification de code sur les GPU AMD Instinct.
Motif de la recommandation :L'article détaille le support out-of-the-box des GPU AMD Instinct dans Transformers et TGI, avec des benchmarks face à l'A100.
Hugging Face publie Optimum-NVIDIA, une bibliothèque d'inférence qui accélère l'inférence des LLM sur la plateforme NVIDIA en modifiant une seule ligne de code.
Motif de la recommandation :L'original expose le point d'entrée d'une ligne, le gain de débit et la prise en charge de FP8, ce qui permet de juger l'impact sur le déploiement existant.
Hugging Face a réduit le temps de démarrage à froid de l'inférence LoRA de 25 s à 3 s et le temps de réponse de 35 s à 13 s en gardant le modèle de base Stable Diffusion XL chargé et en échangeant les adaptateurs LoRA à la demande. Le Hub héberge environ 2500 LoRA publics, dont environ 92 % reposent sur Stable Diffusion XL Base 1.0, et cette mutualisation permet de servir des centaines de LoRA distincts avec moins de 5 GPU A10G. L'article détaille l'implémentation dans Diffusers avec load_lora_weights, fuse_lora, unload_lora_weights et unfuse_lora, ainsi que les temps de chargement et d'inférence mesurés sur T4 et A10G.
Motif de la recommandation :L'article détaille le mécanisme de mutualisation des adaptateurs LoRA et les gains mesurés, utile pour ceux qui déploient plusieurs modèles fine-tunés.
Hugging Face permet désormais de déployer Llama 2 pour la génération de texte sur AWS Inferentia2 via optimum-neuron.
OpenAI annonce au DevDay GPT-4 Turbo avec une fenêtre de contexte de 128K et des prix réduits, la nouvelle Assistants API, GPT-4 Turbo with Vision et l'API DALL·E 3, entre autres.
Motif de la recommandation :Récapitulatif des nouveautés annoncées au DevDay, utile pour situer les changements de modèles et d'API destinés aux développeurs.
Hugging Face présente HugCoder, un LLM de code fine-tuné sur les dépôts publics de l'organisation Hugging Face.
Motif de la recommandation :L'article détaille le workflow complet de collecte de données, de fine-tuning QLoRA et de déploiement local d'un copilote de code, avec des scripts et des configurations réutilisables.
Le blog Hugging Face présente des techniques d'optimisation de Stable Diffusion XL pour réduire la consommation mémoire et accélérer l'inférence.
Hugging Face détaille le déploiement de modèles d'embedding open source sur Inference Endpoints via Text Embeddings Inference (TEI).
Hugging Face publie une reproduction du codebase RLHF original d'OpenAI (openai/lm-human-preferences) et détaille les détails d'implémentation nécessaires pour reproduire ses courbes d'apprentissage sur des tâches stylistiques. Le codebase de reproduction (https://github.com/vwxyzjn/lm-human-preference-details) atteint des courbes quasi identiques à celles d'OpenAI, avec un espace de démonstration et les logs d'entraînement disponibles. L'article identifie une différence entre l'optimiseur Adam de PyTorch et celui de TensorFlow : PyTorch utilise un terme de normalisation plus petit en début d'entraînement, ce qui provoque des mises à jour de gradient plus agressives et affecte davantage les grands modèles comme gpt2-xl.
Hugging Face publie @gradio/lite, une bibliothèque JavaScript qui s'appuie sur Pyodide pour exécuter des applications Gradio directement dans le navigateur.
Motif de la recommandation :Présente le fonctionnement sans serveur de Gradio dans le navigateur et ses limites de chargement, utile pour évaluer les options de déploiement.
Ironclad s'appuie sur GPT-4 pour simplifier le processus de révision des contrats. Le recours à ce modèle vise à alléger cette étape pour les équipes juridiques.
Retool s'appuie sur GPT-4 pour permettre aux entreprises de construire rapidement et en toute sécurité des applications alimentées par l'IA. L'outil vise un déploiement rapide et sécurisé de ce type d'applications en contexte professionnel.
Typeform fait évoluer ses formulaires en ligne vers des expériences de collecte de données dynamiques et conversationnelles en s'appuyant sur GPT-3.5 et GPT-4. Le produit exploite ces modèles pour rendre la saisie plus interactive et adaptative.
ONNX Runtime prend en charge plus de 130 000 modèles compatibles ONNX sur Hugging Face.
Hugging Face explique comment dupliquer et configurer le Space AI Comic Factory pour le déployer sur son propre compte via l'Inference API.
Hugging Face a publié un benchmark de plus de 60 configurations de déploiement de Llama 2 sur Amazon SageMaker avec le Hugging Face LLM Inference Container. Les tests couvrent les tailles 7B, 13B et 70B sur des instances g5.2xlarge, g5.12xlarge, g5.48xlarge (NVIDIA A10G) et p4d.24xlarge (NVIDIA A100 40GB), avec 1, 5, 10 et 20 requêtes simultanées, en comparant notamment la quantification GPTQ 4-bit. Les recommandations distinguent le déploiement le plus économique, le meilleur débit et la meilleure latence ; le code, les données brutes et le tableur sont publiés sur GitHub.
Rocket Money a choisi l'Inference API de Hugging Face pour héberger ses modèles BERT de classification de transactions.
Hugging Face détaille les techniques d'optimisation pour déployer des LLM en production.
Hugging Face explique comment fine-tuner Llama 2 70B avec PyTorch FSDP sur 2 nœuds de 8 GPU A100 80GB.
Motif de la recommandation :Le guide détaille les trois obstacles du fine-tuning de Llama 2 70B sous FSDP et les solutions concrètes apportées par Transformers et Accelerate.