Motif de la recommandation :L'article détaille l'architecture sans attention, les benchmarks comparatifs et le support dans l'écosystème Hugging Face, utile pour évaluer les compromis des SSM.
Motif de la recommandation :L'annonce détaille l'acquisition de XetHub par Hugging Face et les gains attendus pour le stockage des dépôts de modèles et de jeux de données.
Motif de la recommandation :L'article détaille les gains de mémoire mesurés sur trois pipelines de diffusion Transformer avec Quanto, avec des tableaux de latence et de qualité.
Hugging Face présente LAVE (LLM-Assisted VQA Evaluation), une métrique d'évaluation VQA assistée par LLM qui note les réponses de 1 à 3 via Llama-2-Chat-7b.
Motif de la recommandation :Détaille les exigences mémoire, les intégrations et les recettes de quantification de Llama 3.1, utile pour planifier le déploiement et le fine-tuning.
Le blog Hugging Face détaille comment exécuter Mistral 7B sur Mac via Core ML, en utilisant les nouvelles fonctionnalités de la WWDC 24 comme les tenseurs Swift.
Motif de la recommandation :L'article détaille le déploiement d'un modèle de base unique servant 30 adaptateurs LoRA, avec des chiffres de coût et de VRAM pour évaluer la charge opérationnelle.
Motif de la recommandation :Codestral Mamba adopte l'architecture Mamba avec une inférence en temps linéaire et un contexte testé jusqu'à 256k tokens, un point de repère pour évaluer les alternatives aux Transformer sur le code.
Motif de la recommandation :Mathstral 7B atteint 56,6 % sur MATH et 63,47 % sur MMLU, avec des gains supplémentaires via majority voting et reward model, ce qui éclaire les compromis performance/vitesse pour les modèles spécialisés.
Hugging Face détaille la création d'un chatbot pour Argilla 2.0 en s'appuyant sur distilabel pour générer un dataset synthétique et fine-tuner un modèle d'embedding spécialisé. Le processus couvre le chunking de la documentation technique (environ 256 tokens par chunk), la génération de questions synthétiques et d'exemples négatifs difficiles, la création d'une base vectorielle et le déploiement du chatbot sur Hugging Face Spaces. Les interactions sont stockées dans Argilla pour une évaluation et une amélioration continues.
Motif de la recommandation :L'article détaille la curation du corpus et les recettes d'entraînement des petits modèles, utile pour reproduire ou comparer des modèles légers.
Motif de la recommandation :L'article détaille la recette d'entraînement en deux étapes et l'algorithme SC-TIR qui ont permis de résoudre 29 problèmes sur 50, une méthode transférable pour le fine-tuning d'un modèle de raisonnement mathématique.
Motif de la recommandation :L'original expose le format de sauvegarde partagé entre Transformers et KerasHub, ce qui permet de charger directement plus de 300 000 modèles fine-tunés dans KerasHub.
Banque des Territoires (groupe CDC), Polyconseil et Hugging Face ont achevé la première phase d'une solution RAG souveraine destinée à optimiser l'accompagnement du programme EduRénov de rénovation écologique de 10 000 bâtiments scolaires publics. Le dispositif vise 40 % d'économies d'énergie en 5 ans, avec 2 milliards d'euros de prêts et 50 millions d'euros d'ingénierie préparatoire. Après un an, près de 2 000 projets ont été signés, et le CDC a imposé la souveraineté des services de calcul et des modèles, en s'appuyant notamment sur Text Generation Inference, Transformers, Sentence Transformers et Tokenizers de Hugging Face.
Motif de la recommandation :L'original expose la conception d'un Code Agent et sa performance sur GAIA, avec des détails sur l'interpréteur sécurisé et l'orchestration multi-agents.
Motif de la recommandation :L'article détaille les choix techniques de Gemma 2 et son intégration dans l'écosystème Hugging Face, utile pour évaluer les compromis de déploiement.
Motif de la recommandation :L'article détaille l'implémentation de RLOO dans TRL, avec des comparaisons de mémoire et de vitesse face à PPO, utile pour choisir une méthode d'entraînement RLHF.
Stable Diffusion 3 Medium (2B paramètres) de Stability AI est disponible sur le Hugging Face Hub et utilisable avec Diffusers. Le modèle repose sur une architecture MMDiT avec trois encodeurs de texte (CLIP L/14, OpenCLIP bigG/14, T5-v1.1-XXL) et un autoencodeur 16 canaux, entraîné avec un objectif de rectified flow matching. L'intégration Diffusers inclut des optimisations mémoire (offloading CPU, suppression de l'encodeur T5, quantification 8 bits via bitsandbytes) permettant de réduire la consommation de 18,7 Go à 4,3 Go, ainsi que des scripts de fine-tuning DreamBooth et LoRA.
Motif de la recommandation :Le billet détaille l'intégration de SD3 Medium dans Diffusers, avec optimisations mémoire et scripts de fine-tuning LoRA directement réutilisables.
Motif de la recommandation :Falcon 2 11B est publié en version LLM et VLM, avec les détails d'entraînement et les résultats d'évaluation pour situer ses performances.
Hugging Face rend disponible le déploiement de plus de 100 000 modèles publics sur AWS Inferentia2 via Amazon SageMaker et Hugging Face Inference Endpoints.
Hugging Face et Dell lancent Dell Enterprise Hub, une expérience sur Hugging Face permettant d'entraîner et de déployer des modèles ouverts en local sur les plateformes Dell.