Aller au contenu
  1. Hugging Face Blog62

    ServiceNow présente AutoSynthData, un pipeline de génération de données d'entraînement pour agents d'entreprise

    ServiceNow CoreAI présente AutoSynthData, un pipeline qui transforme les échecs d'un modèle cible et les succès d'un enseignant plus fort en nouvelles tâches d'entraînement validées dans l'environnement. Le système génère des tâches composées d'une spécification système, d'un prompt utilisateur et d'un vérificateur, avec des contrôles de faisabilité, de réalisme et de difficulté, puis une vérification positive et négative et une phase de réparation. Sur EnterpriseOps Gym Hybrid, avec Gemma-4-26B-A4B-it comme cible et Qwen3.8-27B comme enseignant, 2 000 échantillons générés en environ 18 heures améliorent le Pass@1 moyen de 7,2 points, soit une hausse relative de 35 %, et le taux de succès du vérificateur passe de 63,01 % à 68,55 %. Sur ITSM, avec DeepSeek-V4.1-Flash comme enseignant, 1 994 échantillons générés en 66 heures font passer le Pass@1 moyen de 18,77 % à 27,18 %.

    Motif de la recommandation :L'article détaille un pipeline de génération de données d'entraînement pour agents d'entreprise, avec les critères de qualité et les résultats chiffrés sur deux domaines.

  1. Hugging Face Blog62

    IBM Research présente le Consistency Analyzer d'ALTK-Evolve pour réduire l'écart de cohérence des agents

    IBM Research présente le Consistency Analyzer, un outil de diagnostic intégré à ALTK-Evolve qui identifie les points de décision instables d'un agent en rééchantillonnant une trajectoire enregistrée, sans vérité terrain ni nouvelle exécution complète. Sur AppWorld test_normal avec un agent ReAct sur GPT-4.1, l'écart de cohérence entre Mean@5 (77,4 %) et Pass^5 (53,0 %) atteint 24,4 points ; les directives de cohérence générées à partir de ces diagnostics réduisent cet écart à 12,0 points, avec Pass^5 à 69,0 % et Mean@5 à 81,0 %. Le dépôt open source ALTK-Evolve inclut désormais l'outil et la génération de directives, et le rapport technique est publié sur arXiv.

    Motif de la recommandation :L'original expose une méthode de diagnostic de la variabilité des agents et des directives correctives, avec des chiffres avant/après sur AppWorld.

  1. Hugging Face Blog70

    Quantization-Aware Healing : un modèle 4 bits compressé surpassant sa version pleine précision

    Multiverse Computing présente Quantization-Aware Healing (QAH), une méthode qui distille directement depuis le modèle original pré-compression plutôt que depuis le checkpoint récupéré.

    Motif de la recommandation :L'article détaille une recette de distillation consciente de la quantification et compare ses résultats à ceux du QAT sur plusieurs benchmarks.

  1. Hugging Face Blog65

    Hugging Face mesure l'optimisation aux benchmarks en reconnaissance vocale

    Hugging Face publie une recherche qui introduit trois tests pour quantifier l'optimisation aux benchmarks en reconnaissance vocale.

    Motif de la recommandation :Trois sondes quantifient l'optimisation aux benchmarks en ASR et montrent que les meilleurs scores WER ne garantissent pas la fidélité au signal audio.

  1. Hugging Face Blog62

    ALTK-Evolve : quelle quantité de mémoire un agent doit-il réellement recevoir ?

    ALTK-Evolve, présenté dans un article du blog Hugging Face, distille des consignes réutilisables à partir des trajectoires passées d'un agent et les réinjecte à l'inférence.

    Motif de la recommandation :L'étude quantifie sur huit modèles le dosage optimal de mémoire agentique et montre qu'une récupération sélective peut gagner en précision tout en réduisant les coûts.

  1. Hugging Face Blog62

    Hugging Face publie son rapport State of Open Models été 2026

    Hugging Face publie son analyse semestrielle State of Open Models couvrant janvier à août 2026. Les dépôts de modèles publics passent de 2.

    Motif de la recommandation :Le rapport quantifie la croissance du Hub, la répartition extrême des téléchargements et la montée des agents, ce qui aide à situer les choix d'écosystème open source.

  1. Hugging Face Blog83

    Hugging Face : ce que la reproduction de 2 200 articles d'ICML a appris

    Hugging Face a organisé du 15 juillet au 2 août 2026 un hackathon où 1 221 participants ont reproduit 2 226 articles d'ICML 2026.

    Motif de la recommandation :Un bilan chiffré de la plus grande reproduction ouverte d'une conférence ML, avec des cas de falsification et le rôle des humains dans la boucle.

  1. Hugging Face Blog60

    Hume lance Real World VoiceEQ, un benchmark pour mesurer la qualité humaine de l'IA vocale

    Hume présente Real World VoiceEQ, un benchmark conçu pour évaluer la qualité humaine des interactions vocales.

    Motif de la recommandation :Le benchmark couvre plus de 40 modèles vocaux et 15 dimensions, avec des données d'évaluation humaine à grande échelle qui permettent de comparer les capacités réelles des systèmes vocaux.

  1. Hugging Face Blog62

    Hugging Face propose agent-eval pour évaluer l'usage agentique des bibliothèques open source

    Hugging Face publie agent-eval, un harnais d'évaluation qui mesure non seulement la réponse finale d'un agent mais aussi le nombre de tours.

    Motif de la recommandation :L'article présente un harnais d'évaluation qui mesure le coût d'exécution des agents sur une bibliothèque, avec des résultats contre-intuitifs sur l'effet du CLI et du Skill selon la taille du modèle.

  1. Hugging Face Blog78

    Granite 4.1 LLM : comment ils sont construits

    IBM publie un descriptif technique détaillé de la construction des Granite 4.1, une famille de LLM denses decoder-only de 3B.

    Motif de la recommandation :L'article détaille le pipeline de pré-entraînement en cinq phases et la recette RL de Granite 4.1, utile pour comprendre comment un dense 8B rivalise avec un MoE 32B.

  1. Hugging Face Blog60

    OpenEnv en pratique : évaluer les agents utilisant des outils dans des environnements réels

    Hugging Face et Meta présentent OpenEnv, un framework open source qui évalue les agents IA contre de vrais systèmes plutôt que des simulations.

    Motif de la recommandation :L'article détaille le framework OpenEnv et le benchmark Calendar Gym, avec des chiffres concrets sur les limites des agents et des cas d'erreur d'appel d'outils réutilisables.

  1. Hugging Face Blog62

    Hugging Face dévoile les coulisses de FineVideo, un jeu de données de 43 000 vidéos annotées

    Hugging Face publie les détails techniques de FineVideo, un jeu de données de 43 000 vidéos totalisant 3 400 heures.

    Motif de la recommandation :L'article détaille le pipeline de filtrage, catégorisation et annotation de FineVideo, avec les compromis techniques et les seuils retenus pour construire un jeu de données vidéo ouvert.

  1. Hugging Face Blog60

    Comment fine-tuner un LLM en 1.58 bit : quantification extrême simplifiée

    Hugging Face explique comment fine-tuner un modèle Llama3 8B existant en quantification extrême 1.58 bit via l'architecture BitNet.

    Motif de la recommandation :L'article détaille des astuces concrètes pour fine-tuner un modèle existant en 1.58 bit, avec code et benchmarks, ce qui permet de reproduire la méthode.

  1. Hugging Face Blog67

    Comment NuminaMath a remporté le 1er AIMO Progress Prize

    Numina et Hugging Face ont remporté le 1er Progress Prize de l'AI Math Olympiad (AIMO) avec NuminaMath 7B TIR.

    Motif de la recommandation :L'article détaille la recette d'entraînement en deux étapes et l'algorithme SC-TIR qui ont permis de résoudre 29 problèmes sur 50, une méthode transférable pour le fine-tuning d'un modèle de raisonnement mathématique.

  1. Hugging Face Blog62

    Le Code Agent de Transformers dépasse le benchmark GAIA

    L'équipe Hugging Face indique que son Code Agent construit avec Transformers Agents atteint 44.

    Motif de la recommandation :L'original expose la conception d'un Code Agent et sa performance sur GAIA, avec des détails sur l'interpréteur sécurisé et l'orchestration multi-agents.

  1. Hugging Face Blog60

    JAT : un agent Transformer polyvalent open source pour jeux vidéo, robotique et navigation

    Hugging Face publie JAT (Jack of All Trades), un agent Transformer unique entraîné sur un dataset de centaines de milliers de trajectoires d'experts couvrant Atari.

    Motif de la recommandation :L'article détaille l'architecture et les résultats d'un agent Transformer unique couvrant jeux vidéo, robotique et navigation, avec dataset et modèles ouverts.

  1. Hugging Face Blog62

    Hugging Face : quantification binaire et scalaire des embeddings pour un retrieval plus rapide et moins coûteux

    Hugging Face présente la quantification des embeddings comme une étape de post-traitement qui réduit la mémoire et le stockage sans réduire la dimensionnalité. La quantification binaire convertit les valeurs float32 en 1 bit, soit une réduction de 32x, et permet de conserver environ 96 % des performances de retrieval grâce à une étape de rescoring avec l'embedding de requête float32 ; la quantification scalaire en int8 réduit la taille de 4x et atteint environ 99 % des performances avec un rescore_multiplier de 4 à 5. Sur un benchmark MTEB Retrieval, la quantification binaire offre un gain de vitesse moyen de 24,76x et la quantification int8 de 3,66x. Une démo combine recherche binaire et rescoring int8 sur 41 millions de textes Wikipédia, avec 5,2 Go de mémoire et 52 Go d'espace disque contre 200 Go pour un retrieval float32 classique. Le code est disponible via Sentence Transformers et des scripts d'exemple.

    Motif de la recommandation :L'article détaille les principes et le code de la quantification binaire et scalaire des embeddings, avec des gains de vitesse et de coût mesurés sur 41 millions de textes.

  1. Hugging Face Blog62

    Cosmopedia : comment créer des données synthétiques à grande échelle pour le pré-entraînement des LLM

    Hugging Face présente Cosmopedia, un jeu de données synthétiques de plus de 30 millions de fichiers et 25 milliards de tokens généré par Mixtral-8x7B-Instruct-v0.1.

    Motif de la recommandation :L'article détaille la construction d'un jeu de données synthétiques de 25 milliards de tokens, avec la méthode de génération des prompts et la pile technique, utile pour ceux qui veulent reproduire ce type de données.

  1. Hugging Face Blog65

    Constitutional AI avec des LLM ouverts : recette complète de Hugging Face

    Hugging Face publie une recette de bout en bout pour appliquer le Constitutional AI (CAI) aux modèles ouverts.

    Motif de la recommandation :L'article fournit une recette complète d'alignement Constitutional AI avec des modèles ouverts, incluant datasets, modèles et outil de génération à grande échelle.

  1. Hugging Face Blog60

    Ce qui se passe avec le classement Open LLM : pourquoi les scores MMLU divergent

    Le classement Open LLM, qui s'appuie sur la bibliothèque EleutherAI LM Evaluation Harness.

    Motif de la recommandation :L'article détaille pourquoi un même benchmark MMLU donne des scores et classements différents selon l'implémentation, un point clé pour interpréter les classements de modèles.