Aller au contenu
  1. Hugging Face Blog62

    ServiceNow présente AutoSynthData, un pipeline de génération de données d'entraînement pour agents d'entreprise

    ServiceNow CoreAI présente AutoSynthData, un pipeline qui transforme les échecs d'un modèle cible et les succès d'un enseignant plus fort en nouvelles tâches d'entraînement validées dans l'environnement. Le système génère des tâches composées d'une spécification système, d'un prompt utilisateur et d'un vérificateur, avec des contrôles de faisabilité, de réalisme et de difficulté, puis une vérification positive et négative et une phase de réparation. Sur EnterpriseOps Gym Hybrid, avec Gemma-4-26B-A4B-it comme cible et Qwen3.8-27B comme enseignant, 2 000 échantillons générés en environ 18 heures améliorent le Pass@1 moyen de 7,2 points, soit une hausse relative de 35 %, et le taux de succès du vérificateur passe de 63,01 % à 68,55 %. Sur ITSM, avec DeepSeek-V4.1-Flash comme enseignant, 1 994 échantillons générés en 66 heures font passer le Pass@1 moyen de 18,77 % à 27,18 %.

    Motif de la recommandation :L'article détaille un pipeline de génération de données d'entraînement pour agents d'entreprise, avec les critères de qualité et les résultats chiffrés sur deux domaines.

  1. Hugging Face Blog62

    IBM Research présente le Consistency Analyzer d'ALTK-Evolve pour réduire l'écart de cohérence des agents

    IBM Research présente le Consistency Analyzer, un outil de diagnostic intégré à ALTK-Evolve qui identifie les points de décision instables d'un agent en rééchantillonnant une trajectoire enregistrée, sans vérité terrain ni nouvelle exécution complète. Sur AppWorld test_normal avec un agent ReAct sur GPT-4.1, l'écart de cohérence entre Mean@5 (77,4 %) et Pass^5 (53,0 %) atteint 24,4 points ; les directives de cohérence générées à partir de ces diagnostics réduisent cet écart à 12,0 points, avec Pass^5 à 69,0 % et Mean@5 à 81,0 %. Le dépôt open source ALTK-Evolve inclut désormais l'outil et la génération de directives, et le rapport technique est publié sur arXiv.

    Motif de la recommandation :L'original expose une méthode de diagnostic de la variabilité des agents et des directives correctives, avec des chiffres avant/après sur AppWorld.

  1. Hugging Face Blog60

    Multiverse Computing 提出让知识蒸馏可大规模运行的低成本方法

    Multiverse Computing 发布论文« Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss »。

    Motif de la recommandation :提出离线 top-K logits 缓存与融合分块 KL 损失两项系统改动, 把长上下文蒸馏显存从数百 GB 降到单卡可跑.

  1. Hugging Face Blog62

    Hugging Face propose agent-eval pour évaluer l'usage agentique des bibliothèques open source

    Hugging Face publie agent-eval, un harnais d'évaluation qui mesure non seulement la réponse finale d'un agent mais aussi le nombre de tours。

    Motif de la recommandation :L'article présente un harnais d'évaluation qui mesure le coût d'exécution des agents sur une bibliothèque, avec des résultats contre-intuitifs sur l'effet du CLI et du Skill selon la taille du modèle.

  1. Hugging Face Blog78

    Granite 4.1 LLM : comment ils sont construits

    IBM publie un descriptif technique détaillé de la construction des Granite 4.1, une famille de LLM denses decoder-only de 3B。

    Motif de la recommandation :L'article détaille le pipeline de pré-entraînement en cinq phases et la recette RL de Granite 4.1, utile pour comprendre comment un dense 8B rivalise avec un MoE 32B.

  1. Google DeepMind67

    Google DeepMind présente Decoupled DiLoCo, une architecture d'entraînement distribué résiliente

    Google DeepMind publie un article sur Decoupled DiLoCo, une architecture distribuée qui divise les entraînements LLM en îlots de calcul découplés avec flux de données asynchrone。

    Motif de la recommandation :L'article détaille l'architecture Decoupled DiLoCo et ses résultats sur Gemma 4, permettant de comprendre comment l'entraînement distribué gagne en résilience et en efficacité.

  1. Google DeepMind78

    Google DeepMind : Gemini Deep Think accélère la découverte mathématique et scientifique

    Google DeepMind publie deux articles détaillant l'utilisation du mode Gemini Deep Think pour résoudre des problèmes de recherche professionnels en mathématiques。

    Motif de la recommandation :L'article détaille l'agent de recherche mathématique Aletheia et les recettes de collaboration humain-IA, avec des cas concrets en mathématiques, physique et informatique.

  1. Google Research62

    Google Research présente Project Suncatcher : exploration d'une conception de système d'infrastructure IA scalable basée dans l'espace

    Google Research a publié le preprint « Towards a future space-based, highly scalable AI infrastructure system design » et dévoile Project Suncatcher。

    Motif de la recommandation :L'article expose le design système, les quatre défis techniques et les données de test des TPU, permettant de comprendre les contraintes réelles du calcul IA dans l'espace.

Fin de la liste