Aller au contenu
  1. Hugging Face Blog62

    ServiceNow présente AutoSynthData, un pipeline de génération de données d'entraînement pour agents d'entreprise

    ServiceNow CoreAI présente AutoSynthData, un pipeline qui transforme les échecs d'un modèle cible et les succès d'un enseignant plus fort en nouvelles tâches d'entraînement validées dans l'environnement. Le système génère des tâches composées d'une spécification système, d'un prompt utilisateur et d'un vérificateur, avec des contrôles de faisabilité, de réalisme et de difficulté, puis une vérification positive et négative et une phase de réparation. Sur EnterpriseOps Gym Hybrid, avec Gemma-4-26B-A4B-it comme cible et Qwen3.8-27B comme enseignant, 2 000 échantillons générés en environ 18 heures améliorent le Pass@1 moyen de 7,2 points, soit une hausse relative de 35 %, et le taux de succès du vérificateur passe de 63,01 % à 68,55 %. Sur ITSM, avec DeepSeek-V4.1-Flash comme enseignant, 1 994 échantillons générés en 66 heures font passer le Pass@1 moyen de 18,77 % à 27,18 %.

    Motif de la recommandation :L'article détaille un pipeline de génération de données d'entraînement pour agents d'entreprise, avec les critères de qualité et les résultats chiffrés sur deux domaines.

  1. Google DeepMind73

    Google DeepMind présente SynthID Bio, une technologie de filigrane pour les protéines générées par IA

    Google DeepMind présente SynthID Bio, une famille de méthodes de filigrane destinée à la biologie de synthèse.

    Motif de la recommandation :Le filigrane s'étend des médias numériques aux séquences protéiques, avec des données de laboratoire humide et une ouverture du code, ce qui permet de comprendre la vérification de la provenance des protéines générées par IA.

  1. Hugging Face Blog70

    NVIDIA publie Kumo Tabular, un modèle de fondation open source pour les données tabulaires

    NVIDIA publie Kumo Tabular, un modèle de fondation open source pour la classification et la régression sur données tabulaires.

    Motif de la recommandation :NVIDIA ouvre un modèle de fondation tabulaire pré-entraîné uniquement sur des données synthétiques, avec poids et bibliothèque d'inférence, ce qui permet de mesurer le passage des arbres boostés à l'apprentissage en contexte.

  1. NVIDIA Blog62

    NVIDIA et Google DeepMind publient des structures protéiques de plus de 2800 virus

    NVIDIA rejoint une coalition incluant Google DeepMind et EMBL-EBI pour publier en accès libre les structures 3D prédites des complexes protéiques de plus de 2800 virus via la base AlphaFold. Les structures ont été inférées avec AlphaFold2 optimisé par NVIDIA BioNeMo Inference Runtime, et NVIDIA publie aussi le BioNeMo Structure Prediction Pipeline utilisé pour générer le jeu de données. Environ 30 % des interactions protéiques ajoutées sont totalement nouvelles pour la science, selon l'annonce.

    Motif de la recommandation :NVIDIA et Google DeepMind ouvrent des structures protéiques virales prédites, un cas concret de données scientifiques partagées pour la préparation pandémique.

  1. Microsoft Research60

    Microsoft Research publie RetroChimera dans Nature pour améliorer la prédiction de synthèse des petites molécules

    Microsoft Research annonce la publication dans Nature de RetroChimera, un modèle de rétrosynthèse qui combine R-SMILES 2.

    Motif de la recommandation :L'article détaille l'architecture d'ensemble et le ré-ordonnancement appris de RetroChimera, ainsi que ses résultats en tests à l'aveugle, ce qui permet de juger de l'apport de la combinaison de deux modèles complémentaires.

  1. Google DeepMind88

    Google DeepMind lance AlphaGenome Atlas, une carte prédictive des 9 milliards de variants du génome humain

    Google DeepMind présente AlphaGenome Atlas, une plateforme contenant les prédictions des effets de 9 milliards de variants mononucléotidiques.

    Motif de la recommandation :Le texte détaille une ressource de 1 pétaoctet couvrant 9 milliards de variants et un score AVI unifié, ce qui permet de situer la portée pratique pour la recherche génomique.

  1. Google Research62

    Google Research publie la carte complète du cerveau de la drosophile mâle

    Google Research, en partenariat avec le HHMI Janelia Research Campus et des collaborateurs de Cambridge。

    Motif de la recommandation :Le texte détaille la méthode de reconstruction assistée par IA et la mise à disposition d'une carte cérébrale ouverte, utile pour comprendre l'état de la connectomique.

  1. Hugging Face Blog65

    Hugging Face mesure l'optimisation aux benchmarks en reconnaissance vocale

    Hugging Face publie une recherche qui introduit trois tests pour quantifier l'optimisation aux benchmarks en reconnaissance vocale。

    Motif de la recommandation :Trois sondes quantifient l'optimisation aux benchmarks en ASR et montrent que les meilleurs scores WER ne garantissent pas la fidélité au signal audio.

  1. Hugging Face Blog62

    ALTK-Evolve : quelle quantité de mémoire un agent doit-il réellement recevoir ?

    ALTK-Evolve, présenté dans un article du blog Hugging Face, distille des consignes réutilisables à partir des trajectoires passées d'un agent et les réinjecte à l'inférence。

    Motif de la recommandation :L'étude quantifie sur huit modèles le dosage optimal de mémoire agentique et montre qu'une récupération sélective peut gagner en précision tout en réduisant les coûts.

  1. Hugging Face Blog62

    Hugging Face publie son rapport State of Open Models été 2026

    Hugging Face publie son analyse semestrielle State of Open Models couvrant janvier à août 2026. Les dépôts de modèles publics passent de 2。

    Motif de la recommandation :Le rapport quantifie la croissance du Hub, la répartition extrême des téléchargements et la montée des agents, ce qui aide à situer les choix d'écosystème open source.

  1. Hugging Face Blog83

    Hugging Face : ce que la reproduction de 2 200 articles d'ICML a appris

    Hugging Face a organisé du 15 juillet au 2 août 2026 un hackathon où 1 221 participants ont reproduit 2 226 articles d'ICML 2026。

    Motif de la recommandation :Un bilan chiffré de la plus grande reproduction ouverte d'une conférence ML, avec des cas de falsification et le rôle des humains dans la boucle.

  1. Hugging Face Blog60

    Multiverse Computing 提出让知识蒸馏可大规模运行的低成本方法

    Multiverse Computing 发布论文« Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss »。

    Motif de la recommandation :提出离线 top-K logits 缓存与融合分块 KL 损失两项系统改动, 把长上下文蒸馏显存从数百 GB 降到单卡可跑.

  1. Google Research78

    Google présente TabFM, un modèle de fondation zero-shot pour les données tabulaires

    Google Research présente TabFM, un modèle de fondation pour la classification et la régression sur données tabulaires qui élimine l'entraînement manuel。

    Motif de la recommandation :L'article détaille l'architecture hybride et l'entraînement sur données synthétiques de TabFM, ce qui permet de comprendre comment le zero-shot s'applique aux données tabulaires.

  1. Hugging Face Blog60

    MosaicLeaks :深度研究Agent的查询隐私泄露基准与PA-DR训练方法

    Hugging Face博客发布MosaicLeaks, 一个针对深度研究Agent的隐私泄露基准, 包含1001条多跳研究链, 交错本地企业文档与受控网页语料。

    Motif de la recommandation :提出多跳研究链上的隐私泄露基准与PA-DR训练方法, 给出可复现的泄露度量与训练效率对比.