StarCoder accéléré avec Optimum Intel sur Xeon : quantification Q8/Q4 et décodage spéculatif
Hugging Face détaille plus de 7x d'accélération de l'inférence du modèle StarCoder-15B sur les processeurs Intel Xeon de 4e génération.
Hugging Face détaille plus de 7x d'accélération de l'inférence du modèle StarCoder-15B sur les processeurs Intel Xeon de 4e génération.
Hugging Face et Google Cloud ont annoncé un partenariat stratégique pour démocratiser le machine learning et permettre aux entreprises de construire leur propre IA avec des modèles ouverts. Les clients de Google Cloud pourront entraîner et déployer les modèles Hugging Face via Google Kubernetes Engine (GKE) et Vertex AI, en s'appuyant sur les TPU, les VM A3 équipées de GPU NVIDIA H100 Tensor Core et les VM C3. Les utilisateurs du Hugging Face Hub bénéficieront du déploiement en production via Inference Endpoints et de l'accélération par TPU sur Hugging Face Spaces, avec des annonces prévues dès ce trimestre.
ONNX Runtime accélère l'inférence de SD Turbo et SDXL Turbo sur GPU NVIDIA.
Hugging Face publie un tutoriel pas à pas pour convertir un workflow ComfyUI en application Gradio et la déployer gratuitement sur Hugging Face Spaces via ZeroGPU. Le processus passe par l'extension ComfyUI-to-Python-Extension pour exporter le workflow en script Python, puis par la création d'une interface Gradio exposant prompt, image de structure, image de style et forces associées. Les modèles sont téléchargés depuis le Hub via hf_hub_download et préchargés hors de la fonction décorée par @spaces.GPU pour tirer parti du serverless. L'auteur indique qu'une automatisation complète du processus est prévue début 2025.
Motif de la recommandation :Un guide pas à pas pour transformer un workflow ComfyUI en application Gradio et l'héberger gratuitement sur ZeroGPU.
Vectara a mis en ligne le HHEM Leaderboard, un classement open source dédié à la mesure de la fréquence d'hallucination des LLM.
Unsloth, une bibliothèque légère développée par la communauté, accélère le fine-tuning des LLM jusqu'à 2x et réduit l'usage de mémoire jusqu'à 74% sans dégradation de précision.
Motif de la recommandation :L'article détaille les gains de vitesse et de mémoire d'Unsloth pour le fine-tuning, avec des benchmarks reproductibles et un exemple d'intégration à TRL.
Le blog Hugging Face montre comment le décodage spéculatif, implémenté comme stratégie « assisted generation » dans Transformers.
Motif de la recommandation :L'article détaille l'implémentation du décodage spéculatif dans Transformers avec des benchmarks reproductibles, permettant de réduire de moitié le temps d'inférence de Whisper sans perte de précision.
Mistral AI publie Mixtral 8x7B, un modèle à mélange d'experts clairsemé (SMoE) à poids ouverts sous licence Apache 2.0. Il surpasse Llama 2 70B sur la plupart des benchmarks avec une inférence 6 fois plus rapide, égale ou dépasse GPT3.5 sur la plupart des benchmarks standards, gère un contexte de 32k tokens et maîtrise l'anglais, le français, l'italien, l'allemand et l'espagnol. Le modèle compte 46,7B paramètres au total mais n'en utilise que 12,9B par token, et Mixtral 8x7B Instruct atteint 8,30 sur MT-Bench. Mistral AI a soumis des modifications à vLLM intégrant les kernels CUDA Megablocks, et Skypilot permet le déploiement des endpoints vLLM sur n'importe quelle instance cloud.
Motif de la recommandation :L'original expose l'architecture MoE, les performances comparées et la pile de déploiement open source, ce qui permet de juger le compromis coût/performance.
Mistral AI ouvre l'accès bêta à sa première plateforme, la plateforme, qui propose trois endpoints de chat et un endpoint d'embedding. mistral-tiny sert Mistral 7B Instruct v0.2.
Motif de la recommandation :L'original expose les trois endpoints de chat et l'endpoint d'embedding, leurs modèles sous-jacents et leurs scores MT-Bench, ce qui permet de comparer le compromis performance/prix avant intégration.
Mistral a publié Mixtral 8x7B, un modèle à mélange d'experts (MoE) qui établit un nouveau niveau SOTA pour les modèles open access et surpasse GPT-3.5 sur de nombreux benchmarks. Hugging Face annonce son intégration complète dans son écosystème : modèles sur le Hub sous licence Apache 2.0, support dans Transformers, Inference Endpoints, Text Generation Inference, et un exemple de fine-tuning sur un seul GPU avec TRL. Le modèle supporte une fenêtre de contexte de 32k tokens, parle anglais, français, allemand, espagnol et italien, et obtient 40,2 % sur HumanEval. Mixtral Instruct dépasse tous les autres modèles open access sur MT-Bench avec un score de 8,30, comparable à GPT-3.5.
Motif de la recommandation :L'article détaille l'intégration complète de Mixtral 8x7B dans l'écosystème Hugging Face, des points de déploiement à la quantification, utile pour évaluer les options d'inférence et de fine-tuning.
Hugging Face publie une explication des Mixture of Experts (MoE), architecture mise en avant par la sortie de Mixtral 8x7B. L'article décrit les deux composants d'une couche MoE.
Motif de la recommandation :L'article détaille les briques, l'entraînement et les compromis de service des MoE, utile pour comprendre l'architecture derrière Mixtral 8x7B.
Hugging Face et AMD annoncent que les modèles Transformers peuvent désormais tourner sans modification de code sur les GPU AMD Instinct.
Motif de la recommandation :L'article détaille le support out-of-the-box des GPU AMD Instinct dans Transformers et TGI, avec des benchmarks face à l'A100.
Hugging Face publie Optimum-NVIDIA, une bibliothèque d'inférence qui accélère l'inférence des LLM sur la plateforme NVIDIA en modifiant une seule ligne de code.
Motif de la recommandation :L'original expose le point d'entrée d'une ligne, le gain de débit et la prise en charge de FP8, ce qui permet de juger l'impact sur le déploiement existant.
Hugging Face a réduit le temps de démarrage à froid de l'inférence LoRA de 25 s à 3 s et le temps de réponse de 35 s à 13 s en gardant le modèle de base Stable Diffusion XL chargé et en échangeant les adaptateurs LoRA à la demande. Le Hub héberge environ 2500 LoRA publics, dont environ 92 % reposent sur Stable Diffusion XL Base 1.0, et cette mutualisation permet de servir des centaines de LoRA distincts avec moins de 5 GPU A10G. L'article détaille l'implémentation dans Diffusers avec load_lora_weights, fuse_lora, unload_lora_weights et unfuse_lora, ainsi que les temps de chargement et d'inférence mesurés sur T4 et A10G.
Motif de la recommandation :L'article détaille le mécanisme de mutualisation des adaptateurs LoRA et les gains mesurés, utile pour ceux qui déploient plusieurs modèles fine-tunés.
Hugging Face permet désormais de déployer Llama 2 pour la génération de texte sur AWS Inferentia2 via optimum-neuron.
Hugging Face présente HugCoder, un LLM de code fine-tuné sur les dépôts publics de l'organisation Hugging Face.
Motif de la recommandation :L'article détaille le workflow complet de collecte de données, de fine-tuning QLoRA et de déploiement local d'un copilote de code, avec des scripts et des configurations réutilisables.
Le blog Hugging Face présente des techniques d'optimisation de Stable Diffusion XL pour réduire la consommation mémoire et accélérer l'inférence.
Hugging Face détaille le déploiement de modèles d'embedding open source sur Inference Endpoints via Text Embeddings Inference (TEI).
Hugging Face publie une reproduction du codebase RLHF original d'OpenAI (openai/lm-human-preferences) et détaille les détails d'implémentation nécessaires pour reproduire ses courbes d'apprentissage sur des tâches stylistiques. Le codebase de reproduction (https://github.com/vwxyzjn/lm-human-preference-details) atteint des courbes quasi identiques à celles d'OpenAI, avec un espace de démonstration et les logs d'entraînement disponibles. L'article identifie une différence entre l'optimiseur Adam de PyTorch et celui de TensorFlow : PyTorch utilise un terme de normalisation plus petit en début d'entraînement, ce qui provoque des mises à jour de gradient plus agressives et affecte davantage les grands modèles comme gpt2-xl.
Hugging Face publie @gradio/lite, une bibliothèque JavaScript qui s'appuie sur Pyodide pour exécuter des applications Gradio directement dans le navigateur.
Motif de la recommandation :Présente le fonctionnement sans serveur de Gradio dans le navigateur et ses limites de chargement, utile pour évaluer les options de déploiement.
ONNX Runtime prend en charge plus de 130 000 modèles compatibles ONNX sur Hugging Face.
Hugging Face explique comment dupliquer et configurer le Space AI Comic Factory pour le déployer sur son propre compte via l'Inference API.
Hugging Face a publié un benchmark de plus de 60 configurations de déploiement de Llama 2 sur Amazon SageMaker avec le Hugging Face LLM Inference Container. Les tests couvrent les tailles 7B, 13B et 70B sur des instances g5.2xlarge, g5.12xlarge, g5.48xlarge (NVIDIA A10G) et p4d.24xlarge (NVIDIA A100 40GB), avec 1, 5, 10 et 20 requêtes simultanées, en comparant notamment la quantification GPTQ 4-bit. Les recommandations distinguent le déploiement le plus économique, le meilleur débit et la meilleure latence ; le code, les données brutes et le tableur sont publiés sur GitHub.
Rocket Money a choisi l'Inference API de Hugging Face pour héberger ses modèles BERT de classification de transactions.
Hugging Face détaille les techniques d'optimisation pour déployer des LLM en production.
Hugging Face explique comment fine-tuner Llama 2 70B avec PyTorch FSDP sur 2 nœuds de 8 GPU A100 80GB.
Motif de la recommandation :Le guide détaille les trois obstacles du fine-tuning de Llama 2 70B sous FSDP et les solutions concrètes apportées par Transformers et Accelerate.
Hugging Face détaille les deux schémas de quantification nativement intégrés à Transformers.
Hugging Face a lancé SafeCoder, une solution d'assistant de code pour l'entreprise.
Fetch a réduit de 50 % la latence de ses scans les plus lents en optimisant son pipeline ML avec Amazon SageMaker et Hugging Face. L'entreprise.
Le blog Hugging Face montre comment utiliser AudioLDM 2 dans la bibliothèque Diffusers avec quatre optimisations cumulables.
Hugging Face annonce l'intégration de Code Llama, une famille de modèles ouverts dérivés de Llama 2 spécialisés sur le code.
Motif de la recommandation :Présente les trois tailles de Code Llama, la fenêtre de contexte étendue et l'intégration complète dans l'écosystème Hugging Face.
Hugging Face annonce l'intégration de la bibliothèque AutoGPTQ dans Transformers.
Motif de la recommandation :L'intégration d'AutoGPTQ dans Transformers permet de quantifier et exécuter des LLM en 4, 3 ou 2 bits avec une perte de précision négligeable et une latence proche du fp16.
Hugging Face annonce SafeCoder, une solution commerciale complète d'assistant de code auto-hébergée pour l'entreprise.
Motif de la recommandation :Hugging Face détaille une solution d'assistant code auto-hébergée pour l'entreprise, avec les contraintes de conformité et le choix des modèles open source.
Hugging Face Hub est désormais disponible sur AWS Marketplace.
BentoML, plateforme open source de serving de modèles ML, permet de déployer DeepFloyd IF.
Hugging Face montre comment accélérer Bark, le modèle TTS de Suno AI disponible dans Transformers depuis la v4.31.0.
Hugging Face présente l'implémentation de la méthode Direct Preference Optimization (DPO) dans la bibliothèque TRL et montre comment fine-tuner le modèle Llama 2 7B sur le jeu de données de préférences Stack Exchange. DPO remplace l'étape de modélisation de récompense et l'optimisation RL de RLHF par un objectif de vraisemblance directe optimisé via une simple perte d'entropie croisée binaire, en s'appuyant sur une correspondance analytique entre la fonction de récompense et la politique RL optimale. Le tutoriel détaille le pipeline complet : SFT avec QLoRA sur Llama 2 7B, préparation des données de préférence au format prompt/chosen/rejected, puis entraînement avec DPOTrainer en configurant le paramètre beta (0,1 à 0,5). Le code source des scripts d'entraînement est disponible dans le répertoire examples/stack_llama_2 et le modèle entraîné est publié sur le Hub Hugging Face.
Motif de la recommandation :Le tutoriel détaille l'implémentation de DPO dans TRL et le fine-tuning de Llama 2, avec le code et les métriques de suivi.
Hugging Face explique comment déployer MusicGen, le modèle de génération musicale texte-vers-audio.
Zama démontre qu'il est possible d'exécuter une partie de l'inférence d'un LLM sur des données chiffrées grâce au chiffrement homomorphe complet (FHE).
Meta publie Llama 2, une famille de grands modèles de langage open access de 7B à 70B paramètres.
Motif de la recommandation :Présente l'intégration complète de Llama 2 dans Hugging Face, avec les modèles, l'inférence et le fine-tuning, utile pour évaluer les options de déploiement.