Hugging Face et Microsoft approfondissent leur collaboration : modèles ouverts sur Azure, Phi-3 et Spaces Dev Mode
Hugging Face et Microsoft approfondissent leur collaboration stratégique avec l'ajout de Llama 3。
Hugging Face et Microsoft approfondissent leur collaboration stratégique avec l'ajout de Llama 3。
Hugging Face et Dell lancent Dell Enterprise Hub, une expérience sur Hugging Face permettant d'entraîner et de déployer des modèles ouverts en local sur les plateformes Dell。
Hugging Face annonce l'intégration de première classe des GPU AMD Instinct MI300 dans sa plateforme。
Hugging Face et LangChain lancent langchain_huggingface。
Hugging Face dévoile l'Open Arabic LLM Leaderboard (OALL), un classement dédié à l'évaluation des LLM arabes。
Hugging Face publie Transformers Agents 2.0, qui introduit deux nouveaux agents capables d'itérer à partir d'observations passées pour résoudre des tâches complexes。
Motif de la recommandation :Le cadre d'agents open source expose la séparation entre moteur LLM et type d'agent, ainsi que les résultats comparés de Llama-3-70B et GPT-4 sur GAIA.
Hugging Face lance un leaderboard ouvert dédié à l'évaluation des LLM en hébreu。
Hugging Face présente l'Open CoT Leaderboard, un classement qui mesure le gain de précision apporté par le chain-of-thought (Δ = précision avec CoT – précision sans CoT) plutôt que la précision absolue des LLM. Il évalue les tâches LogiQA, LSAT et AGIEval/logikon-bench, en rendant les modèles plus robustes à la contamination des données d'entraînement. Deux stratégies de génération de traces de raisonnement sont implémentées : Classic (« Let's think step by step ») et Reflect.
Hugging Face publie JAT (Jack of All Trades), un agent Transformer unique entraîné sur un dataset de centaines de milliers de trajectoires d'experts couvrant Atari。
Motif de la recommandation :L'article détaille l'architecture et les résultats d'un agent Transformer unique couvrant jeux vidéo, robotique et navigation, avec dataset et modèles ouverts.
Hugging Face lance Deploy on Google Cloud, une intégration du Hub permettant de déployer des milliers de modèles ouverts sur Google Cloud via Vertex AI ou GKE。
Hugging Face annonce un partenariat avec Wiz Research visant à renforcer la sécurité de sa plateforme et de l'écosystème AI/ML。
Hugging Face annonce Deploy on Cloudflare Workers AI。
Hugging Face présente la quantification des embeddings comme une étape de post-traitement qui réduit la mémoire et le stockage sans réduire la dimensionnalité. La quantification binaire convertit les valeurs float32 en 1 bit, soit une réduction de 32x, et permet de conserver environ 96 % des performances de retrieval grâce à une étape de rescoring avec l'embedding de requête float32 ; la quantification scalaire en int8 réduit la taille de 4x et atteint environ 99 % des performances avec un rescore_multiplier de 4 à 5. Sur un benchmark MTEB Retrieval, la quantification binaire offre un gain de vitesse moyen de 24,76x et la quantification int8 de 3,66x. Une démo combine recherche binaire et rescoring int8 sur 41 millions de textes Wikipédia, avec 5,2 Go de mémoire et 52 Go d'espace disque contre 200 Go pour un retrieval float32 classique. Le code est disponible via Sentence Transformers et des scripts d'exemple.
Motif de la recommandation :L'article détaille les principes et le code de la quantification binaire et scalaire des embeddings, avec des gains de vitesse et de coût mesurés sur 41 millions de textes.
Hugging Face Transformers est une bibliothèque Python open source donnant accès à des milliers de modèles Transformer pré-entraînés pour le NLP。
Lighthouz AI lance la Chatbot Guardrails Arena en collaboration avec Hugging Face。
Hugging Face introduit Quanto, un backend de quantification PyTorch pour Optimum。
Argilla et Hugging Face lancent « Data is Better Together », une expérience de construction collective d'un dataset de préférences par classement de prompts。
Mistral AI publie Mistral Large, son nouveau modèle phare de génération de texte。
Motif de la recommandation :Mistral Large est présenté comme le deuxième modèle disponible via API derrière GPT-4, avec fenêtre de 32K et function calling, ce qui éclaire les choix de déploiement.
Upstage a lancé en septembre 2023 l'Open Ko-LLM Leaderboard, une plateforme d'évaluation ouverte dédiée aux LLM coréens。
Hugging Face a ajouté à PEFT de nouvelles méthodes de fusion d'adaptateurs LoRA。
AMD lance le Pervasive AI Developer Contest, un concours mondial avec Hugging Face offrant 700 plateformes AMD et 160 000 USD de prix。
Hugging Face introduit Messages API, qui apporte la compatibilité avec l'API OpenAI Chat Completion à Text Generation Inference (TGI) et Inference Endpoints à partir de la version 1.4.0 de TGI. L'API peut être utilisée directement avec les bibliothèques clientes d'OpenAI ou des outils tiers comme LangChain et LlamaIndex, et elle est disponible sur Inference Endpoints en versions dédiée et serverless. Elle ne prend pas encore en charge le function calling et ne fonctionne qu'avec les LLM disposant d'un chat_template défini dans la configuration de leur tokenizer, comme Mixtral 8x7B Instruct.
Motif de la recommandation :L'original détaille la compatibilité OpenAI de TGI et les étapes de migration, ce qui aide le lecteur à évaluer le coût de bascule vers des LLM ouverts.
SegMoE est un framework permettant de créer des modèles de diffusion Mixture-of-Experts à partir de modèles pré-entraînés。
Motif de la recommandation :SegMoE permet de créer des modèles de diffusion Mixture-of-Experts à partir de modèles pré-entraînés, avec un package et une intégration diffusers directement réutilisables.
Hugging Face publie une recette de bout en bout pour appliquer le Constitutional AI (CAI) aux modèles ouverts。
Motif de la recommandation :L'article fournit une recette complète d'alignement Constitutional AI avec des modèles ouverts, incluant datasets, modèles et outil de génération à grande échelle.
Hugging Face et Google Cloud ont annoncé un partenariat stratégique pour démocratiser le machine learning et permettre aux entreprises de construire leur propre IA avec des modèles ouverts. Les clients de Google Cloud pourront entraîner et déployer les modèles Hugging Face via Google Kubernetes Engine (GKE) et Vertex AI, en s'appuyant sur les TPU, les VM A3 équipées de GPU NVIDIA H100 Tensor Core et les VM C3. Les utilisateurs du Hugging Face Hub bénéficieront du déploiement en production via Inference Endpoints et de l'accélération par TPU sur Hugging Face Spaces, avec des annonces prévues dès ce trimestre.
Hugging Face présente comment construire des agents ReAct avec des LLM open source via la classe ChatHuggingFace intégrée à LangChain。
Motif de la recommandation :L'article détaille le fonctionnement interne des agents ReAct et fournit un benchmark comparant plusieurs LLM open source à GPT-3.5 et GPT-4.
Unsloth, une bibliothèque légère développée par la communauté, accélère le fine-tuning des LLM jusqu'à 2x et réduit l'usage de mémoire jusqu'à 74% sans dégradation de précision。
Motif de la recommandation :L'article détaille les gains de vitesse et de mémoire d'Unsloth pour le fine-tuning, avec des benchmarks reproductibles et un exemple d'intégration à TRL.
Hugging Face dresse une rétrospective de 2023 comme année des LLM open source。
Mistral a publié Mixtral 8x7B, un modèle à mélange d'experts (MoE) qui établit un nouveau niveau SOTA pour les modèles open access et surpasse GPT-3.5 sur de nombreux benchmarks. Hugging Face annonce son intégration complète dans son écosystème : modèles sur le Hub sous licence Apache 2.0, support dans Transformers, Inference Endpoints, Text Generation Inference, et un exemple de fine-tuning sur un seul GPU avec TRL. Le modèle supporte une fenêtre de contexte de 32k tokens, parle anglais, français, allemand, espagnol et italien, et obtient 40,2 % sur HumanEval. Mixtral Instruct dépasse tous les autres modèles open access sur MT-Bench avec un score de 8,30, comparable à GPT-3.5.
Motif de la recommandation :L'article détaille l'intégration complète de Mixtral 8x7B dans l'écosystème Hugging Face, des points de déploiement à la quantification, utile pour évaluer les options d'inférence et de fine-tuning.
Hugging Face publie une explication des Mixture of Experts (MoE), architecture mise en avant par la sortie de Mixtral 8x7B. L'article décrit les deux composants d'une couche MoE。
Motif de la recommandation :L'article détaille les briques, l'entraînement et les compromis de service des MoE, utile pour comprendre l'architecture derrière Mixtral 8x7B.
Hugging Face et AMD annoncent que les modèles Transformers peuvent désormais tourner sans modification de code sur les GPU AMD Instinct。
Motif de la recommandation :L'article détaille le support out-of-the-box des GPU AMD Instinct dans Transformers et TGI, avec des benchmarks face à l'A100.
Hugging Face a réduit le temps de démarrage à froid de l'inférence LoRA de 25 s à 3 s et le temps de réponse de 35 s à 13 s en gardant le modèle de base Stable Diffusion XL chargé et en échangeant les adaptateurs LoRA à la demande. Le Hub héberge environ 2500 LoRA publics, dont environ 92 % reposent sur Stable Diffusion XL Base 1.0, et cette mutualisation permet de servir des centaines de LoRA distincts avec moins de 5 GPU A10G. L'article détaille l'implémentation dans Diffusers avec load_lora_weights, fuse_lora, unload_lora_weights et unfuse_lora, ainsi que les temps de chargement et d'inférence mesurés sur T4 et A10G.
Motif de la recommandation :L'article détaille le mécanisme de mutualisation des adaptateurs LoRA et les gains mesurés, utile pour ceux qui déploient plusieurs modèles fine-tunés.
Hugging Face présente HugCoder, un LLM de code fine-tuné sur les dépôts publics de l'organisation Hugging Face。
Motif de la recommandation :L'article détaille le workflow complet de collecte de données, de fine-tuning QLoRA et de déploiement local d'un copilote de code, avec des scripts et des configurations réutilisables.
Hugging Face publie @gradio/lite, une bibliothèque JavaScript qui s'appuie sur Pyodide pour exécuter des applications Gradio directement dans le navigateur。
Motif de la recommandation :Présente le fonctionnement sans serveur de Gradio dans le navigateur et ses limites de chargement, utile pour évaluer les options de déploiement.
ONNX Runtime prend en charge plus de 130 000 modèles compatibles ONNX sur Hugging Face。
Hugging Face annonce que ses tokenizers disposent désormais d'un attribut chat_template。
Motif de la recommandation :L'article explique comment les chat templates stockent le format d'entraînement dans le tokenizer et évitent une dégradation silencieuse des performances.
Mistral AI annonce la sortie de Mistral 7B, son premier modèle de 7B paramètres。
Motif de la recommandation :Mistral AI expose sa position sur les modèles ouverts et publie Mistral 7B sous Apache 2.0, avec des repères de performance sur les benchmarks standards.
L'équipe Diffusers et les auteurs de T2I-Adapter ont collaboré pour intégrer le support des T2I-Adapters pour Stable Diffusion XL (SDXL) dans diffusers. T2I-Adapter-SDXL ne pèse que 79 M de paramètres (158 Mo en fp16), soit une réduction de 93,69 % par rapport à ControlNet-SDXL (1251 M, 2,5 Go), et n'est exécuté qu'une seule fois pendant tout le processus de débruitage. Les points de contrôle entraînés sur 3M d'images LAION-Aesthetics V2 sont disponibles pour les conditions sketch, canny, lineart, depth et openpose, avec un script d'entraînement et un exemple d'utilisation via StableDiffusionXLAdapterPipeline.
Motif de la recommandation :L'article détaille l'entraînement et l'usage des T2I-Adapters pour SDXL, avec des scripts et des points de contrôle ouverts, permettant de reproduire et de contrôler la génération d'images.
Le Falcon 180B de TII rejoint Hugging Face Hub, avec 180 milliards de paramètres entraînés sur 3。
Motif de la recommandation :Falcon 180B est le plus grand modèle ouvert à sa sortie, avec 180B paramètres et 3,5T tokens d'entraînement, ce qui permet de situer les capacités des modèles ouverts face aux modèles propriétaires.
Hugging Face annonce l'intégration de la bibliothèque AutoGPTQ dans Transformers。
Motif de la recommandation :L'intégration d'AutoGPTQ dans Transformers permet de quantifier et exécuter des LLM en 4, 3 ou 2 bits avec une perte de précision négligeable et une latence proche du fp16.