Hugging Face sur les GPU AMD Instinct MI300
Hugging Face annonce l'intégration de première classe des GPU AMD Instinct MI300 dans sa plateforme.
Hugging Face annonce l'intégration de première classe des GPU AMD Instinct MI300 dans sa plateforme.
Hugging Face intègre la quantification du KV cache dans Transformers.
Google publie PaliGemma, une famille de modèles vision-langage open source composée d'un encodeur d'images SigLIP-So400m et d'un décodeur de texte Gemma-2B. Trois types de checkpoints sont disponibles (pré-entraînés, mix et fine-tunés), en résolutions 224x224, 448x448 et 896x896 et en précisions bfloat16, float16 et float32, avec intégration à transformers et à l'implémentation JAX d'origine. Les modèles mix atteignent 46,00 de précision MMVP et 88,00 de précision POPE en 224, tandis que les modèles fine-tunés couvrent des tâches comme VQAv2, COCO Captions, ScienceQA et refcoco.
Motif de la recommandation :Présentation des trois variantes de PaliGemma, de leur architecture SigLIP+Gemma et des scores de benchmarks transférés, utile pour évaluer les modèles vision-langage open source.
Hugging Face et LangChain lancent langchain_huggingface.
Hugging Face dévoile l'Open Arabic LLM Leaderboard (OALL), un classement dédié à l'évaluation des LLM arabes.
Hugging Face publie Transformers Agents 2.0, qui introduit deux nouveaux agents capables d'itérer à partir d'observations passées pour résoudre des tâches complexes.
Motif de la recommandation :Le cadre d'agents open source expose la séparation entre moteur LLM et type d'agent, ainsi que les résultats comparés de Llama-3-70B et GPT-4 sur GAIA.
Hugging Face permet désormais de passer une organisation au forfait Enterprise Hub en utilisant un compte AWS.
Intel présente dans un blog comment déployer des applications RAG d'entreprise via OPEA (Open Platform for Enterprise AI).
Hugging Face lance un leaderboard ouvert dédié à l'évaluation des LLM en hébreu.
Artificial Analysis apporte son LLM Performance Leaderboard sur Hugging Face, un classement qui évalue qualité.
Hugging Face montre comment déployer sur Inference Endpoints un pipeline combinant Whisper (openai/whisper-large-v3).
Hugging Face et Dottxt proposent d'utiliser la génération structurée, via la bibliothèque Outlines.
Hugging Face publie StarCoder2-15B-Instruct-v0.1, présenté comme le premier LLM de code entièrement auto-aligné entraîné via un pipeline transparent et permissif. Le modèle génère lui-même des paires instruction-réponse à partir de StarCoder2-15B, sans annotation humaine ni distillation de LLM propriétaires, et atteint 72,6 sur HumanEval, surpassant les 72,0 de CodeLlama-70B-Instruct. Sur LiveCodeBench, il devance même la version du même modèle entraînée sur des données distillées de GPT-4, ce qui suggère qu'un LLM apprend plus efficacement sur sa propre distribution. Les datasets et l'intégralité du pipeline sont open source.
Motif de la recommandation :Le pipeline entièrement ouvert et l'auto-alignement sans données distillées de GPT-4 permettent de reproduire et d'adapter la méthode à d'autres modèles de code.
Hugging Face présente l'Open CoT Leaderboard, un classement qui mesure le gain de précision apporté par le chain-of-thought (Δ = précision avec CoT – précision sans CoT) plutôt que la précision absolue des LLM. Il évalue les tâches LogiQA, LSAT et AGIEval/logikon-bench, en rendant les modèles plus robustes à la contamination des données d'entraînement. Deux stratégies de génération de traces de raisonnement sont implémentées : Classic (« Let's think step by step ») et Reflect.
Hugging Face publie JAT (Jack of All Trades), un agent Transformer unique entraîné sur un dataset de centaines de milliers de trajectoires d'experts couvrant Atari.
Motif de la recommandation :L'article détaille l'architecture et les résultats d'un agent Transformer unique couvrant jeux vidéo, robotique et navigation, avec dataset et modèles ouverts.
Hugging Face lance le Open Medical-LLM Leaderboard.
Meta publie Llama 3, la nouvelle génération de sa famille de LLM open source, disponible sur Hugging Face en versions 8B et 70B.
Motif de la recommandation :L'article détaille les spécifications de Llama 3, les intégrations dans l'écosystème Hugging Face et les méthodes de déploiement, ce qui permet de comprendre les capacités du modèle et les options d'utilisation.
Hugging Face met en ligne le classement LiveCodeBench, fondé sur un benchmark développé par des chercheurs de UC Berkeley.
Zama a mis en ligne des modèles Concrete ML pré-compilés sur Hugging Face Endpoints.
Ryght a lancé Ryght Preview, une plateforme SaaS d'IA générative destinée aux secteurs de la santé et des sciences de la vie.
Gradio propose un mode reload qui permet de recharger automatiquement les modifications du code source sans redémarrer le serveur.
Hugging Face publie Idefics2, un modèle multimodal généraliste de 8B paramètres sous licence Apache 2.0.
Motif de la recommandation :Idefics2, avec 8B de paramètres et une licence Apache 2.0, atteint des performances comparables à des modèles de 30B et plus sur plusieurs benchmarks, ce qui permet de situer les capacités des modèles multimodaux ouverts de cette taille.
Hugging Face publie un guide sur les vision language models (VLM), des modèles multimodaux qui prennent en entrée images et texte pour générer du texte.
Hugging Face lance Deploy on Google Cloud, une intégration du Hub permettant de déployer des milliers de modèles ouverts sur Google Cloud via Vertex AI ou GKE.
Google publie CodeGemma, une famille de modèles ouverts spécialisés dans le code.
Motif de la recommandation :L'article détaille les trois variantes de CodeGemma, leurs formats de prompt et les résultats sur HumanEval, ce qui aide à évaluer l'usage en complétion de code.
Hugging Face annonce un partenariat avec Wiz Research visant à renforcer la sécurité de sa plateforme et de l'écosystème AI/ML.
MotherDuck et Numbers Station ont publié DuckDB-NSQL-7B, un LLM spécialisé dans le DuckDB SQL.
Hugging Face montre que l'optimisation d'un modèle SetFit avec Optimum Intel permet d'accélérer l'inférence de 7.
Hugging Face annonce Deploy on Cloudflare Workers AI.
L'équipe Pollen Robotics lance pollen-vision, une bibliothèque open source qui combine OWL-ViT.
Hugging Face présente la quantification des embeddings comme une étape de post-traitement qui réduit la mémoire et le stockage sans réduire la dimensionnalité. La quantification binaire convertit les valeurs float32 en 1 bit, soit une réduction de 32x, et permet de conserver environ 96 % des performances de retrieval grâce à une étape de rescoring avec l'embedding de requête float32 ; la quantification scalaire en int8 réduit la taille de 4x et atteint environ 99 % des performances avec un rescore_multiplier de 4 à 5. Sur un benchmark MTEB Retrieval, la quantification binaire offre un gain de vitesse moyen de 24,76x et la quantification int8 de 3,66x. Une démo combine recherche binaire et rescoring int8 sur 41 millions de textes Wikipédia, avec 5,2 Go de mémoire et 52 Go d'espace disque contre 200 Go pour un retrieval float32 classique. Le code est disponible via Sentence Transformers et des scripts d'exemple.
Motif de la recommandation :L'article détaille les principes et le code de la quantification binaire et scalaire des embeddings, avec des gains de vitesse et de coût mesurés sur 41 millions de textes.
Hugging Face Transformers est une bibliothèque Python open source donnant accès à des milliers de modèles Transformer pré-entraînés pour le NLP.
Lighthouz AI lance la Chatbot Guardrails Arena en collaboration avec Hugging Face.
Hugging Face présente Cosmopedia, un jeu de données synthétiques de plus de 30 millions de fichiers et 25 milliards de tokens généré par Mixtral-8x7B-Instruct-v0.1.
Motif de la recommandation :L'article détaille la construction d'un jeu de données synthétiques de 25 milliards de tokens, avec la méthode de génération des prompts et la pile technique, utile pour ceux qui veulent reproduire ce type de données.
Hugging Face montre comment exécuter le modèle Phi-2 (2,7 milliards de paramètres) quantifié en 4 bits sur un laptop équipé d'un CPU Intel Core Ultra 7 155H.
Le blog Hugging Face présente GaLore, une méthode qui projette les gradients dans un sous-espace de bas rang pour réduire la mémoire des états d'optimiseur de plus de 82.
Motif de la recommandation :L'article détaille la réduction de plus de 82,5 % de la mémoire des états d'optimiseur et fournit un exemple exécutable avec transformers, utile pour l'entraînement sur GPU grand public.
Hugging Face introduit Quanto, un backend de quantification PyTorch pour Optimum.
Hugging Face lance Train on DGX Cloud, un service du Hub réservé aux organisations Enterprise Hub.
Hugging Face présente WebSight, un dataset synthétique de paires capture d'écran et code HTML destiné à entraîner des systèmes d'IA capables de transformer des maquettes web en code HTML fonctionnel. Après la version v0.1 de janvier 2024 contenant 823 000 paires, la mise à jour v0.2 introduit des images réelles dans les captures d'écran, passe à Tailwind CSS et porte le dataset à 2 millions d'exemples. En s'appuyant sur WebSight, Hugging Face a fine-tuné son futur modèle de fondation vision-langage pour obtenir Sightseer, capable de convertir des captures d'écran de pages web en HTML fonctionnel et d'y intégrer des images proches de celles de l'original. Le dataset, le rapport technique et un notebook Colab sont disponibles en open source.
Des chercheurs de l'University of California Los Angeles ont publié ConTextual.