Motif de la recommandation :L'article détaille le déploiement d'un modèle de base unique servant 30 adaptateurs LoRA, avec des chiffres de coût et de VRAM pour évaluer la charge opérationnelle.
Hugging Face détaille la création d'un chatbot pour Argilla 2.0 en s'appuyant sur distilabel pour générer un dataset synthétique et fine-tuner un modèle d'embedding spécialisé. Le processus couvre le chunking de la documentation technique (environ 256 tokens par chunk), la génération de questions synthétiques et d'exemples négatifs difficiles, la création d'une base vectorielle et le déploiement du chatbot sur Hugging Face Spaces. Les interactions sont stockées dans Argilla pour une évaluation et une amélioration continues.
Motif de la recommandation :L'original expose le format de sauvegarde partagé entre Transformers et KerasHub, ce qui permet de charger directement plus de 300 000 modèles fine-tunés dans KerasHub.
Banque des Territoires (groupe CDC), Polyconseil et Hugging Face ont achevé la première phase d'une solution RAG souveraine destinée à optimiser l'accompagnement du programme EduRénov de rénovation écologique de 10 000 bâtiments scolaires publics. Le dispositif vise 40 % d'économies d'énergie en 5 ans, avec 2 milliards d'euros de prêts et 50 millions d'euros d'ingénierie préparatoire. Après un an, près de 2 000 projets ont été signés, et le CDC a imposé la souveraineté des services de calcul et des modèles, en s'appuyant notamment sur Text Generation Inference, Transformers, Sentence Transformers et Tokenizers de Hugging Face.
Motif de la recommandation :L'article détaille les choix techniques de Gemma 2 et son intégration dans l'écosystème Hugging Face, utile pour évaluer les compromis de déploiement.
Motif de la recommandation :L'article détaille l'implémentation de RLOO dans TRL, avec des comparaisons de mémoire et de vitesse face à PPO, utile pour choisir une méthode d'entraînement RLHF.
Motif de la recommandation :Mistral ouvre trois voies de personnalisation, du SDK open source au fine-tuning serverless, ce qui permet de situer le coût et l'effort requis selon son infrastructure.
Hugging Face rend disponible le déploiement de plus de 100 000 modèles publics sur AWS Inferentia2 via Amazon SageMaker et Hugging Face Inference Endpoints。
Hugging Face et Dell lancent Dell Enterprise Hub, une expérience sur Hugging Face permettant d'entraîner et de déployer des modèles ouverts en local sur les plateformes Dell。
Motif de la recommandation :L'article détaille les spécifications de Llama 3, les intégrations dans l'écosystème Hugging Face et les méthodes de déploiement, ce qui permet de comprendre les capacités du modèle et les options d'utilisation.
Hugging Face publie un guide sur les vision language models (VLM), des modèles multimodaux qui prennent en entrée images et texte pour générer du texte。
Hugging Face lance Deploy on Google Cloud, une intégration du Hub permettant de déployer des milliers de modèles ouverts sur Google Cloud via Vertex AI ou GKE。
Hugging Face présente la quantification des embeddings comme une étape de post-traitement qui réduit la mémoire et le stockage sans réduire la dimensionnalité. La quantification binaire convertit les valeurs float32 en 1 bit, soit une réduction de 32x, et permet de conserver environ 96 % des performances de retrieval grâce à une étape de rescoring avec l'embedding de requête float32 ; la quantification scalaire en int8 réduit la taille de 4x et atteint environ 99 % des performances avec un rescore_multiplier de 4 à 5. Sur un benchmark MTEB Retrieval, la quantification binaire offre un gain de vitesse moyen de 24,76x et la quantification int8 de 3,66x. Une démo combine recherche binaire et rescoring int8 sur 41 millions de textes Wikipédia, avec 5,2 Go de mémoire et 52 Go d'espace disque contre 200 Go pour un retrieval float32 classique. Le code est disponible via Sentence Transformers et des scripts d'exemple.
Motif de la recommandation :L'article détaille les principes et le code de la quantification binaire et scalaire des embeddings, avec des gains de vitesse et de coût mesurés sur 41 millions de textes.
Hugging Face montre comment exécuter le modèle Phi-2 (2,7 milliards de paramètres) quantifié en 4 bits sur un laptop équipé d'un CPU Intel Core Ultra 7 155H。