Aller au contenu
5mois21jourmardi
5mois14jourmardi
5mois13jourlundi
  1. Hugging Face Blog67

    Hugging Face lance Transformers Agents 2.0, avec un agent Llama-3-70B surpassant les agents basés sur GPT-4 sur GAIA

    Hugging Face publie Transformers Agents 2.0, qui introduit deux nouveaux agents capables d'itérer à partir d'observations passées pour résoudre des tâches complexes。

    Motif de la recommandation :Le cadre d'agents open source expose la séparation entre moteur LLM et type d'agent, ainsi que les résultats comparés de Llama-3-70B et GPT-4 sur GAIA.

5mois5jourdimanche
4mois23jourmardi
  1. Hugging Face Blog38

    Hugging Face lance le classement Open Chain of Thought

    Hugging Face présente l'Open CoT Leaderboard, un classement qui mesure le gain de précision apporté par le chain-of-thought (Δ = précision avec CoT – précision sans CoT) plutôt que la précision absolue des LLM. Il évalue les tâches LogiQA, LSAT et AGIEval/logikon-bench, en rendant les modèles plus robustes à la contamination des données d'entraînement. Deux stratégies de génération de traces de raisonnement sont implémentées : Classic (« Let's think step by step ») et Reflect.

4mois22jourlundi
  1. Hugging Face Blog60

    JAT : un agent Transformer polyvalent open source pour jeux vidéo, robotique et navigation

    Hugging Face publie JAT (Jack of All Trades), un agent Transformer unique entraîné sur un dataset de centaines de milliers de trajectoires d'experts couvrant Atari。

    Motif de la recommandation :L'article détaille l'architecture et les résultats d'un agent Transformer unique couvrant jeux vidéo, robotique et navigation, avec dataset et modèles ouverts.

4mois10jourmercredi
4mois4jourjeudi
4mois2jourmardi
3mois22jourvendredi
  1. Hugging Face Blog62

    Hugging Face : quantification binaire et scalaire des embeddings pour un retrieval plus rapide et moins coûteux

    Hugging Face présente la quantification des embeddings comme une étape de post-traitement qui réduit la mémoire et le stockage sans réduire la dimensionnalité. La quantification binaire convertit les valeurs float32 en 1 bit, soit une réduction de 32x, et permet de conserver environ 96 % des performances de retrieval grâce à une étape de rescoring avec l'embedding de requête float32 ; la quantification scalaire en int8 réduit la taille de 4x et atteint environ 99 % des performances avec un rescore_multiplier de 4 à 5. Sur un benchmark MTEB Retrieval, la quantification binaire offre un gain de vitesse moyen de 24,76x et la quantification int8 de 3,66x. Une démo combine recherche binaire et rescoring int8 sur 41 millions de textes Wikipédia, avec 5,2 Go de mémoire et 52 Go d'espace disque contre 200 Go pour un retrieval float32 classique. Le code est disponible via Sentence Transformers et des scripts d'exemple.

    Motif de la recommandation :L'article détaille les principes et le code de la quantification binaire et scalaire des embeddings, avec des gains de vitesse et de coût mesurés sur 41 millions de textes.

3mois21jourjeudi
3mois18jourlundi
3mois4jourlundi
2mois26jourlundi
2mois20jourmardi
2mois19jourlundi
2mois14jourmercredi
2mois8jourjeudi
  1. Hugging Face Blog62

    Hugging Face ajoute Messages API compatible OpenAI à TGI et Inference Endpoints

    Hugging Face introduit Messages API, qui apporte la compatibilité avec l'API OpenAI Chat Completion à Text Generation Inference (TGI) et Inference Endpoints à partir de la version 1.4.0 de TGI. L'API peut être utilisée directement avec les bibliothèques clientes d'OpenAI ou des outils tiers comme LangChain et LlamaIndex, et elle est disponible sur Inference Endpoints en versions dédiée et serverless. Elle ne prend pas encore en charge le function calling et ne fonctionne qu'avec les LLM disposant d'un chat_template défini dans la configuration de leur tokenizer, comme Mixtral 8x7B Instruct.

    Motif de la recommandation :L'original détaille la compatibilité OpenAI de TGI et les étapes de migration, ce qui aide le lecteur à évaluer le coût de bascule vers des LLM ouverts.

2mois3joursamedi
  1. Hugging Face Blog62

    SegMoE : un framework pour créer des modèles de diffusion Mixture-of-Experts

    SegMoE est un framework permettant de créer des modèles de diffusion Mixture-of-Experts à partir de modèles pré-entraînés。

    Motif de la recommandation :SegMoE permet de créer des modèles de diffusion Mixture-of-Experts à partir de modèles pré-entraînés, avec un package et une intégration diffusers directement réutilisables.

2mois1jourjeudi
  1. Hugging Face Blog65

    Constitutional AI avec des LLM ouverts : recette complète de Hugging Face

    Hugging Face publie une recette de bout en bout pour appliquer le Constitutional AI (CAI) aux modèles ouverts。

    Motif de la recommandation :L'article fournit une recette complète d'alignement Constitutional AI avec des modèles ouverts, incluant datasets, modèles et outil de génération à grande échelle.

1mois25jourjeudi
  1. Hugging Face Blog40

    Hugging Face et Google Cloud annoncent un partenariat stratégique pour l'IA ouverte

    Hugging Face et Google Cloud ont annoncé un partenariat stratégique pour démocratiser le machine learning et permettre aux entreprises de construire leur propre IA avec des modèles ouverts. Les clients de Google Cloud pourront entraîner et déployer les modèles Hugging Face via Google Kubernetes Engine (GKE) et Vertex AI, en s'appuyant sur les TPU, les VM A3 équipées de GPU NVIDIA H100 Tensor Core et les VM C3. Les utilisateurs du Hugging Face Hub bénéficieront du déploiement en production via Inference Endpoints et de l'accélération par TPU sur Hugging Face Spaces, avec des annonces prévues dès ce trimestre.

1mois24jourmercredi
1mois10jourmercredi
  1. Hugging Face Blog62

    Unsloth et TRL : fine-tuning LLM 2x plus rapide

    Unsloth, une bibliothèque légère développée par la communauté, accélère le fine-tuning des LLM jusqu'à 2x et réduit l'usage de mémoire jusqu'à 74% sans dégradation de précision。

    Motif de la recommandation :L'article détaille les gains de vitesse et de mémoire d'Unsloth pour le fine-tuning, avec des benchmarks reproductibles et un exemple d'intégration à TRL.

12mois18jourlundi
12mois11jourlundi
  1. Hugging Face Blog85

    Hugging Face intègre Mixtral 8x7B, un modèle MoE open source SOTA

    Mistral a publié Mixtral 8x7B, un modèle à mélange d'experts (MoE) qui établit un nouveau niveau SOTA pour les modèles open access et surpasse GPT-3.5 sur de nombreux benchmarks. Hugging Face annonce son intégration complète dans son écosystème : modèles sur le Hub sous licence Apache 2.0, support dans Transformers, Inference Endpoints, Text Generation Inference, et un exemple de fine-tuning sur un seul GPU avec TRL. Le modèle supporte une fenêtre de contexte de 32k tokens, parle anglais, français, allemand, espagnol et italien, et obtient 40,2 % sur HumanEval. Mixtral Instruct dépasse tous les autres modèles open access sur MT-Bench avec un score de 8,30, comparable à GPT-3.5.

    Motif de la recommandation :L'article détaille l'intégration complète de Mixtral 8x7B dans l'écosystème Hugging Face, des points de déploiement à la quantification, utile pour évaluer les options d'inférence et de fine-tuning.

  2. Hugging Face Blog60

    Mixture of Experts expliqué : briques, entraînement et compromis de service

    Hugging Face publie une explication des Mixture of Experts (MoE), architecture mise en avant par la sortie de Mixtral 8x7B. L'article décrit les deux composants d'une couche MoE。

    Motif de la recommandation :L'article détaille les briques, l'entraînement et les compromis de service des MoE, utile pour comprendre l'architecture derrière Mixtral 8x7B.

12mois5jourmardi
  1. Hugging Face Blog62

    Hugging Face : comment accélérer l'inférence LoRA de 300 % en gardant le modèle de base chaud

    Hugging Face a réduit le temps de démarrage à froid de l'inférence LoRA de 25 s à 3 s et le temps de réponse de 35 s à 13 s en gardant le modèle de base Stable Diffusion XL chargé et en échangeant les adaptateurs LoRA à la demande. Le Hub héberge environ 2500 LoRA publics, dont environ 92 % reposent sur Stable Diffusion XL Base 1.0, et cette mutualisation permet de servir des centaines de LoRA distincts avec moins de 5 GPU A10G. L'article détaille l'implémentation dans Diffusers avec load_lora_weights, fuse_lora, unload_lora_weights et unfuse_lora, ainsi que les temps de chargement et d'inférence mesurés sur T4 et A10G.

    Motif de la recommandation :L'article détaille le mécanisme de mutualisation des adaptateurs LoRA et les gains mesurés, utile pour ceux qui déploient plusieurs modèles fine-tunés.

10mois27jourvendredi
  1. Hugging Face Blog62

    Personal Copilot : entraîner son propre assistant de codage avec StarCoder

    Hugging Face présente HugCoder, un LLM de code fine-tuné sur les dépôts publics de l'organisation Hugging Face。

    Motif de la recommandation :L'article détaille le workflow complet de collecte de données, de fine-tuning QLoRA et de déploiement local d'un copilote de code, avec des scripts et des configurations réutilisables.

10mois19jourjeudi
  1. Hugging Face Blog60

    Gradio-Lite : exécuter Gradio entièrement dans le navigateur sans serveur

    Hugging Face publie @gradio/lite, une bibliothèque JavaScript qui s'appuie sur Pyodide pour exécuter des applications Gradio directement dans le navigateur。

    Motif de la recommandation :Présente le fonctionnement sans serveur de Gradio dans le navigateur et ses limites de chargement, utile pour évaluer les options de déploiement.

10mois4jourmercredi
10mois3jourmardi
9mois27jourmercredi
9mois8jourvendredi
  1. Hugging Face Blog62

    Génération contrôlable efficace pour SDXL avec T2I-Adapters

    L'équipe Diffusers et les auteurs de T2I-Adapter ont collaboré pour intégrer le support des T2I-Adapters pour Stable Diffusion XL (SDXL) dans diffusers. T2I-Adapter-SDXL ne pèse que 79 M de paramètres (158 Mo en fp16), soit une réduction de 93,69 % par rapport à ControlNet-SDXL (1251 M, 2,5 Go), et n'est exécuté qu'une seule fois pendant tout le processus de débruitage. Les points de contrôle entraînés sur 3M d'images LAION-Aesthetics V2 sont disponibles pour les conditions sketch, canny, lineart, depth et openpose, avec un script d'entraînement et un exemple d'utilisation via StableDiffusionXLAdapterPipeline.

    Motif de la recommandation :L'article détaille l'entraînement et l'usage des T2I-Adapters pour SDXL, avec des scripts et des points de contrôle ouverts, permettant de reproduire et de contrôler la génération d'images.

9mois6jourmercredi
  1. Hugging Face Blog83

    Hugging Face accueille Falcon 180B, le plus grand modèle ouvert avec 180 milliards de paramètres

    Le Falcon 180B de TII rejoint Hugging Face Hub, avec 180 milliards de paramètres entraînés sur 3。

    Motif de la recommandation :Falcon 180B est le plus grand modèle ouvert à sa sortie, avec 180B paramètres et 3,5T tokens d'entraînement, ce qui permet de situer les capacités des modèles ouverts face aux modèles propriétaires.

8mois23jourmercredi