XLSCOUT dévoile ParaEmbed 2.0, un modèle d'embedding pour brevets et PI avec le soutien de Hugging Face
XLSCOUT a dévoilé ParaEmbed 2.0, un modèle d'embedding propriétaire destiné aux brevets et à la propriété intellectuelle。
XLSCOUT a dévoilé ParaEmbed 2.0, un modèle d'embedding propriétaire destiné aux brevets et à la propriété intellectuelle。
Le modèle vision-langage Florence-2 de Microsoft (0,2B et 0,7B paramètres) peut être fine-tuné pour la réponse visuelle à des questions (VQA)。
Prezi 加入 Hugging Face Expert Support Program, 将更小, 更高效的 open-source 模型集成到其 ML 工作流中. 其旗舰产品 Prezi AI 通过 prompt 自动生成演示文稿草稿。
Hugging Face Accelerate expose désormais DeepSpeed et PyTorch FSDP de manière harmonisée。
Hugging Face présente le RLOO (REINFORCE Leave One-Out) Trainer dans TRL。
Motif de la recommandation :L'article détaille l'implémentation de RLOO dans TRL, avec des comparaisons de mémoire et de vitesse face à PPO, utile pour choisir une méthode d'entraînement RLHF.
Hugging Face annonce la disponibilité générale de son Embedding Container pour Amazon SageMaker。
Hugging Face entreprend une refonte de la documentation de Transformers。
Mistral AI annonce la personnalisation de modèles sur la Plateforme, avec trois points d'entrée 。
Motif de la recommandation :Mistral ouvre trois voies de personnalisation, du SDK open source au fine-tuning serverless, ce qui permet de situer le coût et l'effort requis selon son infrastructure.
Hugging Face a intégré le support de la génération assistée (Assisted Generation) pour Intel Gaudi dans Optimum Habana。
Hugging Face présente l'outil TGI Benchmarking, installé avec Text Generation Inference。
Hugging Face rend disponible le déploiement de plus de 100 000 modèles publics sur AWS Inferentia2 via Amazon SageMaker et Hugging Face Inference Endpoints。
Hugging Face et Microsoft approfondissent leur collaboration stratégique avec l'ajout de Llama 3。
Hugging Face et Dell lancent Dell Enterprise Hub, une expérience sur Hugging Face permettant d'entraîner et de déployer des modèles ouverts en local sur les plateformes Dell。
Hugging Face annonce l'intégration de première classe des GPU AMD Instinct MI300 dans sa plateforme。
Hugging Face intègre la quantification du KV cache dans Transformers。
Hugging Face et LangChain lancent langchain_huggingface。
Hugging Face permet désormais de passer une organisation au forfait Enterprise Hub en utilisant un compte AWS。
Intel présente dans un blog comment déployer des applications RAG d'entreprise via OPEA (Open Platform for Enterprise AI)。
Hugging Face montre comment déployer sur Inference Endpoints un pipeline combinant Whisper (openai/whisper-large-v3)。
Hugging Face et Dottxt proposent d'utiliser la génération structurée, via la bibliothèque Outlines。
Meta publie Llama 3, la nouvelle génération de sa famille de LLM open source, disponible sur Hugging Face en versions 8B et 70B。
Motif de la recommandation :L'article détaille les spécifications de Llama 3, les intégrations dans l'écosystème Hugging Face et les méthodes de déploiement, ce qui permet de comprendre les capacités du modèle et les options d'utilisation.
Hugging Face met en ligne le classement LiveCodeBench, fondé sur un benchmark développé par des chercheurs de UC Berkeley。
Zama a mis en ligne des modèles Concrete ML pré-compilés sur Hugging Face Endpoints。
Ryght a lancé Ryght Preview, une plateforme SaaS d'IA générative destinée aux secteurs de la santé et des sciences de la vie。
Gradio propose un mode reload qui permet de recharger automatiquement les modifications du code source sans redémarrer le serveur。
Hugging Face publie un guide sur les vision language models (VLM), des modèles multimodaux qui prennent en entrée images et texte pour générer du texte。
Hugging Face lance Deploy on Google Cloud, une intégration du Hub permettant de déployer des milliers de modèles ouverts sur Google Cloud via Vertex AI ou GKE。
Hugging Face montre que l'optimisation d'un modèle SetFit avec Optimum Intel permet d'accélérer l'inférence de 7。
Hugging Face annonce Deploy on Cloudflare Workers AI。
L'équipe Pollen Robotics lance pollen-vision, une bibliothèque open source qui combine OWL-ViT。
Hugging Face présente la quantification des embeddings comme une étape de post-traitement qui réduit la mémoire et le stockage sans réduire la dimensionnalité. La quantification binaire convertit les valeurs float32 en 1 bit, soit une réduction de 32x, et permet de conserver environ 96 % des performances de retrieval grâce à une étape de rescoring avec l'embedding de requête float32 ; la quantification scalaire en int8 réduit la taille de 4x et atteint environ 99 % des performances avec un rescore_multiplier de 4 à 5. Sur un benchmark MTEB Retrieval, la quantification binaire offre un gain de vitesse moyen de 24,76x et la quantification int8 de 3,66x. Une démo combine recherche binaire et rescoring int8 sur 41 millions de textes Wikipédia, avec 5,2 Go de mémoire et 52 Go d'espace disque contre 200 Go pour un retrieval float32 classique. Le code est disponible via Sentence Transformers et des scripts d'exemple.
Motif de la recommandation :L'article détaille les principes et le code de la quantification binaire et scalaire des embeddings, avec des gains de vitesse et de coût mesurés sur 41 millions de textes.
Hugging Face Transformers est une bibliothèque Python open source donnant accès à des milliers de modèles Transformer pré-entraînés pour le NLP。
Hugging Face montre comment exécuter le modèle Phi-2 (2,7 milliards de paramètres) quantifié en 4 bits sur un laptop équipé d'un CPU Intel Core Ultra 7 155H。
Le blog Hugging Face présente GaLore, une méthode qui projette les gradients dans un sous-espace de bas rang pour réduire la mémoire des états d'optimiseur de plus de 82。
Motif de la recommandation :L'article détaille la réduction de plus de 82,5 % de la mémoire des états d'optimiseur et fournit un exemple exécutable avec transformers, utile pour l'entraînement sur GPU grand public.
Hugging Face introduit Quanto, un backend de quantification PyTorch pour Optimum。
Hugging Face lance Train on DGX Cloud, un service du Hub réservé aux organisations Enterprise Hub。
Hugging Face 展示了如何通过 Optimum Intel 与 fastRAG 在 Xeon CPU 上加速 BGE 嵌入模型. 文章以 45M, 110M。
Hugging Face détaille un pipeline de génération de texte pour les modèles Llama 2 (7b。
Mistral AI publie Mistral Large, son nouveau modèle phare de génération de texte。
Motif de la recommandation :Mistral Large est présenté comme le deuxième modèle disponible via API derrière GPT-4, avec fenêtre de 32K et function calling, ce qui éclaire les choix de déploiement.
Hugging Face détaille le fine-tuning PEFT des modèles Gemma de Google DeepMind (2B et 7B。