Aller au contenu
10mois2jourvendredi
  1. Hugging Face Blog62

    ServiceNow présente AutoSynthData, un pipeline de génération de données d'entraînement pour agents d'entreprise

    ServiceNow CoreAI présente AutoSynthData, un pipeline qui transforme les échecs d'un modèle cible et les succès d'un enseignant plus fort en nouvelles tâches d'entraînement validées dans l'environnement. Le système génère des tâches composées d'une spécification système, d'un prompt utilisateur et d'un vérificateur, avec des contrôles de faisabilité, de réalisme et de difficulté, puis une vérification positive et négative et une phase de réparation. Sur EnterpriseOps Gym Hybrid, avec Gemma-4-26B-A4B-it comme cible et Qwen3.8-27B comme enseignant, 2 000 échantillons générés en environ 18 heures améliorent le Pass@1 moyen de 7,2 points, soit une hausse relative de 35 %, et le taux de succès du vérificateur passe de 63,01 % à 68,55 %. Sur ITSM, avec DeepSeek-V4.1-Flash comme enseignant, 1 994 échantillons générés en 66 heures font passer le Pass@1 moyen de 18,77 % à 27,18 %.

    Motif de la recommandation :L'article détaille un pipeline de génération de données d'entraînement pour agents d'entreprise, avec les critères de qualité et les résultats chiffrés sur deux domaines.

9mois30jourmercredi
9mois29jourmardi
  1. Hugging Face Blog30

    ProvenanceGuard : vérification de factualité sensible aux sources pour les agents MCP

    Hugging Face publie ProvenanceGuard, une couche de vérification post-génération pour les agents MCP qui distingue la source réelle de chaque affirmation au lieu de fusionner les preuves. Testé sur 281 traces d'un agent médical, il a détecté 138 des 139 affirmations jugées non valides par des experts et identifié la bonne source dans environ 86 % des cas. La méthode conserve l'identité des sources à travers décomposition, routage, scoring et réparation de type RARR, sans réentraîner l'agent.

9mois16jourmercredi
  1. Hugging Face Blog62

    IBM Research présente le Consistency Analyzer d'ALTK-Evolve pour réduire l'écart de cohérence des agents

    IBM Research présente le Consistency Analyzer, un outil de diagnostic intégré à ALTK-Evolve qui identifie les points de décision instables d'un agent en rééchantillonnant une trajectoire enregistrée, sans vérité terrain ni nouvelle exécution complète. Sur AppWorld test_normal avec un agent ReAct sur GPT-4.1, l'écart de cohérence entre Mean@5 (77,4 %) et Pass^5 (53,0 %) atteint 24,4 points ; les directives de cohérence générées à partir de ces diagnostics réduisent cet écart à 12,0 points, avec Pass^5 à 69,0 % et Mean@5 à 81,0 %. Le dépôt open source ALTK-Evolve inclut désormais l'outil et la génération de directives, et le rapport technique est publié sur arXiv.

    Motif de la recommandation :L'original expose une méthode de diagnostic de la variabilité des agents et des directives correctives, avec des chiffres avant/après sur AppWorld.

9mois2jourmercredi
  1. Hugging Face Blog36

    BenchMIRT : que mesurent réellement les benchmarks de LLM ?

    Hugging Face présente BenchMIRT, une méthode qui applique l'Item Response Theory multidimensionnelle (MIRT) au niveau de chaque prompt pour auditer les benchmarks de LLM. Entraînée sur les résultats de 100 LLM, 16 benchmarks et plus de 34K questions, elle identifie sans supervision deux dimensions dominantes : sécurité et raisonnement général. L'analyse montre que les scores de BBQ et WMDP sont davantage liés au raisonnement général qu'à la sécurité, et que les questions de copyright de HarmBench se rapprochent aussi du raisonnement général, signe qu'un score unique peut mélanger plusieurs signaux.

8mois28jourvendredi
8mois25jourmardi
  1. Hugging Face Blog67

    IBM 发布 Granite 4.2 推理模型系列, 含 3B, 8B, 30B 三档

    IBM Granite 团队发布 Granite 4.2, 这是其首个稠密, 仅解码器的推理模型系列, 包含 3B, 8B, 30B 三个规模, 基于 Granite-4.1 基座模型后训练而来. Granite-4.1 基座从零预训练。

    Motif de la recommandation :Granite 4.2 公开了从预训练到多阶段 RL 的完整构建细节, 可对照其 3B/8B/30B 三档能力差异判断落地选型.

  2. Hugging Face Blog70

    Quantization-Aware Healing : un modèle 4 bits compressé surpassant sa version pleine précision

    Multiverse Computing présente Quantization-Aware Healing (QAH), une méthode qui distille directement depuis le modèle original pré-compression plutôt que depuis le checkpoint récupéré。

    Motif de la recommandation :L'article détaille une recette de distillation consciente de la quantification et compare ses résultats à ceux du QAT sur plusieurs benchmarks.

8mois21jourvendredi
8mois19jourmercredi
  1. Hugging Face Blog62

    ALTK-Evolve : quelle quantité de mémoire un agent doit-il réellement recevoir ?

    ALTK-Evolve, présenté dans un article du blog Hugging Face, distille des consignes réutilisables à partir des trajectoires passées d'un agent et les réinjecte à l'inférence。

    Motif de la recommandation :L'étude quantifie sur huit modèles le dosage optimal de mémoire agentique et montre qu'une récupération sélective peut gagner en précision tout en réduisant les coûts.

8mois14jourvendredi
  1. Hugging Face Blog62

    Hugging Face publie son rapport State of Open Models été 2026

    Hugging Face publie son analyse semestrielle State of Open Models couvrant janvier à août 2026. Les dépôts de modèles publics passent de 2。

    Motif de la recommandation :Le rapport quantifie la croissance du Hub, la répartition extrême des téléchargements et la montée des agents, ce qui aide à situer les choix d'écosystème open source.

8mois13jourjeudi
  1. Hugging Face Blog83

    Hugging Face : ce que la reproduction de 2 200 articles d'ICML a appris

    Hugging Face a organisé du 15 juillet au 2 août 2026 un hackathon où 1 221 participants ont reproduit 2 226 articles d'ICML 2026。

    Motif de la recommandation :Un bilan chiffré de la plus grande reproduction ouverte d'une conférence ML, avec des cas de falsification et le rôle des humains dans la boucle.

8mois11jourmardi
8mois10jourlundi
7mois15jourmercredi
  1. Hugging Face Blog60

    Hume lance Real World VoiceEQ, un benchmark pour mesurer la qualité humaine de l'IA vocale

    Hume présente Real World VoiceEQ, un benchmark conçu pour évaluer la qualité humaine des interactions vocales。

    Motif de la recommandation :Le benchmark couvre plus de 40 modèles vocaux et 15 dimensions, avec des données d'évaluation humaine à grande échelle qui permettent de comparer les capacités réelles des systèmes vocaux.

7mois1jourmercredi
6mois30jourmardi
6mois24jourmercredi
6mois18jourjeudi
  1. Hugging Face Blog62

    Hugging Face propose agent-eval pour évaluer l'usage agentique des bibliothèques open source

    Hugging Face publie agent-eval, un harnais d'évaluation qui mesure non seulement la réponse finale d'un agent mais aussi le nombre de tours。

    Motif de la recommandation :L'article présente un harnais d'évaluation qui mesure le coût d'exécution des agents sur une bibliothèque, avec des résultats contre-intuitifs sur l'effet du CLI et du Skill selon la taille du modèle.

6mois3jourmercredi
4mois29jourmercredi
4mois21jourmardi
  1. Hugging Face Blog40

    QIMMA قِمّة : un leaderboard arabe LLM axé sur la qualité des benchmarks

    Hugging Face présente QIMMA قِمّة, un leaderboard arabe de LLM qui valide la qualité des benchmarks avant d'évaluer les modèles. La plateforme agrège 109 sous-ensembles issus de 14 benchmarks, soit plus de 52 000 échantillons couvrant 7 domaines, avec 99 % de contenu natif arabe et la première évaluation de code en arabe via HumanEval+ et MBPP+. Le pipeline de validation, combinant Qwen3-235B-A22B-Instruct et DeepSeek-V3-671B puis une revue humaine, a écarté jusqu'à 3,1 % des échantillons d'ArabicMMLU, révélant des problèmes systématiques de réponses, de formatage et de sensibilité culturelle.

4mois16jourjeudi
4mois15jourmercredi
3mois31jourmardi
3mois24jourmardi
3mois10jourmardi
2mois12jourjeudi
  1. Hugging Face Blog60

    OpenEnv en pratique : évaluer les agents utilisant des outils dans des environnements réels

    Hugging Face et Meta présentent OpenEnv, un framework open source qui évalue les agents IA contre de vrais systèmes plutôt que des simulations。

    Motif de la recommandation :L'article détaille le framework OpenEnv et le benchmark Calendar Gym, avec des chiffres concrets sur les limites des agents et des cas d'erreur d'appel d'outils réutilisables.

2mois3jourmardi
1mois27jourmardi
1mois21jourmercredi
10mois23jourmercredi
10mois1jourmardi
9mois23jourlundi
  1. Hugging Face Blog62

    Hugging Face dévoile les coulisses de FineVideo, un jeu de données de 43 000 vidéos annotées

    Hugging Face publie les détails techniques de FineVideo, un jeu de données de 43 000 vidéos totalisant 3 400 heures。

    Motif de la recommandation :L'article détaille le pipeline de filtrage, catégorisation et annotation de FineVideo, avec les compromis techniques et les seuils retenus pour construire un jeu de données vidéo ouvert.

9mois18jourmercredi
  1. Hugging Face Blog60

    Comment fine-tuner un LLM en 1.58 bit : quantification extrême simplifiée

    Hugging Face explique comment fine-tuner un modèle Llama3 8B existant en quantification extrême 1.58 bit via l'architecture BitNet。

    Motif de la recommandation :L'article détaille des astuces concrètes pour fine-tuner un modèle existant en 1.58 bit, avec code et benchmarks, ce qui permet de reproduire la méthode.

8mois27jourmardi
8mois14jourmercredi
7mois25jourjeudi
7mois18jourjeudi