Les pratiques d'ingénierie pour faire tourner les modèles : optimisation de l'inférence, mémoire GPU et coûts, architectures de serving et choix d'infrastructure.
175 sélections30 derniers jours 25 entréesTotal : 483 entrées
Motif de la recommandation :L'API unifiée d'appel d'outils et les templates de chat permettent de porter le même code entre Mistral, Cohere, NousResearch et Llama, ce qui réduit le travail d'adaptation par modèle.
Motif de la recommandation :Mistral AI expose en détail la personnalisation de modèles, les Agents en alpha et le SDK 1.0, ce qui permet de juger des changements concrets pour les développeurs.
Motif de la recommandation :L'article détaille les gains de mémoire mesurés sur trois pipelines de diffusion Transformer avec Quanto, avec des tableaux de latence et de qualité.
Motif de la recommandation :Détaille les exigences mémoire, les intégrations et les recettes de quantification de Llama 3.1, utile pour planifier le déploiement et le fine-tuning.
Motif de la recommandation :Mistral NeMo est un modèle 12B à fenêtre de 128k, sous licence Apache 2.0, avec un tokenizer Tekken plus efficace et une quantification FP8, ce qui permet d'évaluer les compromis entre taille, contexte et coût d'inférence.
Motif de la recommandation :L'article détaille le déploiement d'un modèle de base unique servant 30 adaptateurs LoRA, avec des chiffres de coût et de VRAM pour évaluer la charge opérationnelle.
Motif de la recommandation :L'original expose le format de sauvegarde partagé entre Transformers et KerasHub, ce qui permet de charger directement plus de 300 000 modèles fine-tunés dans KerasHub.
Motif de la recommandation :L'article détaille les choix techniques de Gemma 2 et son intégration dans l'écosystème Hugging Face, utile pour évaluer les compromis de déploiement.
Motif de la recommandation :L'article détaille l'implémentation de RLOO dans TRL, avec des comparaisons de mémoire et de vitesse face à PPO, utile pour choisir une méthode d'entraînement RLHF.
Motif de la recommandation :Mistral ouvre trois voies de personnalisation, du SDK open source au fine-tuning serverless, ce qui permet de situer le coût et l'effort requis selon son infrastructure.
Motif de la recommandation :L'article détaille les spécifications de Llama 3, les intégrations dans l'écosystème Hugging Face et les méthodes de déploiement, ce qui permet de comprendre les capacités du modèle et les options d'utilisation.
Hugging Face présente la quantification des embeddings comme une étape de post-traitement qui réduit la mémoire et le stockage sans réduire la dimensionnalité. La quantification binaire convertit les valeurs float32 en 1 bit, soit une réduction de 32x, et permet de conserver environ 96 % des performances de retrieval grâce à une étape de rescoring avec l'embedding de requête float32 ; la quantification scalaire en int8 réduit la taille de 4x et atteint environ 99 % des performances avec un rescore_multiplier de 4 à 5. Sur un benchmark MTEB Retrieval, la quantification binaire offre un gain de vitesse moyen de 24,76x et la quantification int8 de 3,66x. Une démo combine recherche binaire et rescoring int8 sur 41 millions de textes Wikipédia, avec 5,2 Go de mémoire et 52 Go d'espace disque contre 200 Go pour un retrieval float32 classique. Le code est disponible via Sentence Transformers et des scripts d'exemple.
Motif de la recommandation :L'article détaille les principes et le code de la quantification binaire et scalaire des embeddings, avec des gains de vitesse et de coût mesurés sur 41 millions de textes.
Le blog Hugging Face présente GaLore, une méthode qui projette les gradients dans un sous-espace de bas rang pour réduire la mémoire des états d'optimiseur de plus de 82.
Motif de la recommandation :L'article détaille la réduction de plus de 82,5 % de la mémoire des états d'optimiseur et fournit un exemple exécutable avec transformers, utile pour l'entraînement sur GPU grand public.
Motif de la recommandation :Mistral Large est présenté comme le deuxième modèle disponible via API derrière GPT-4, avec fenêtre de 32K et function calling, ce qui éclaire les choix de déploiement.
Motif de la recommandation :L'article détaille l'intégration complète de Gemma dans l'écosystème Hugging Face, du déploiement à l'affinage, avec des exemples de code exécutables.
Hugging Face détaille une méthode pour créer des données synthétiques avec le LLM open source Mixtral-8x7B-Instruct-v0.1 afin d'entraîner un petit modèle spécialisé.
Motif de la recommandation :Un cas concret de distillation par données synthétiques avec coûts, latence et émissions comparés à GPT-4, et des notebooks réutilisables.
Hugging Face introduit Messages API, qui apporte la compatibilité avec l'API OpenAI Chat Completion à Text Generation Inference (TGI) et Inference Endpoints à partir de la version 1.4.0 de TGI. L'API peut être utilisée directement avec les bibliothèques clientes d'OpenAI ou des outils tiers comme LangChain et LlamaIndex, et elle est disponible sur Inference Endpoints en versions dédiée et serverless. Elle ne prend pas encore en charge le function calling et ne fonctionne qu'avec les LLM disposant d'un chat_template défini dans la configuration de leur tokenizer, comme Mixtral 8x7B Instruct.
Motif de la recommandation :L'original détaille la compatibilité OpenAI de TGI et les étapes de migration, ce qui aide le lecteur à évaluer le coût de bascule vers des LLM ouverts.
Hugging Face publie un tutoriel pas à pas pour convertir un workflow ComfyUI en application Gradio et la déployer gratuitement sur Hugging Face Spaces via ZeroGPU. Le processus passe par l'extension ComfyUI-to-Python-Extension pour exporter le workflow en script Python, puis par la création d'une interface Gradio exposant prompt, image de structure, image de style et forces associées. Les modèles sont téléchargés depuis le Hub via hf_hub_download et préchargés hors de la fonction décorée par @spaces.GPU pour tirer parti du serverless. L'auteur indique qu'une automatisation complète du processus est prévue début 2025.
Unsloth, une bibliothèque légère développée par la communauté, accélère le fine-tuning des LLM jusqu'à 2x et réduit l'usage de mémoire jusqu'à 74% sans dégradation de précision.
Motif de la recommandation :L'article détaille les gains de vitesse et de mémoire d'Unsloth pour le fine-tuning, avec des benchmarks reproductibles et un exemple d'intégration à TRL.
Motif de la recommandation :L'article détaille l'implémentation du décodage spéculatif dans Transformers avec des benchmarks reproductibles, permettant de réduire de moitié le temps d'inférence de Whisper sans perte de précision.