Aller au contenu
  1. The Decoder76

    BootLoops, un harnais open source pour des calculs scientifiques exacts avec l'IA

    Dans un article invité publié par Anthropic, le physicien de Harvard Matthew Schwartz présente BootLoops.

    Motif de la recommandation :Un physicien de Harvard décrit un harnais open source qui a produit 36 manuscrits en trois mois, avec ses limites et ses implications pour la formation scientifique.

  1. Hugging Face Blog62

    ServiceNow présente AutoSynthData, un pipeline de génération de données d'entraînement pour agents d'entreprise

    ServiceNow CoreAI présente AutoSynthData, un pipeline qui transforme les échecs d'un modèle cible et les succès d'un enseignant plus fort en nouvelles tâches d'entraînement validées dans l'environnement. Le système génère des tâches composées d'une spécification système, d'un prompt utilisateur et d'un vérificateur, avec des contrôles de faisabilité, de réalisme et de difficulté, puis une vérification positive et négative et une phase de réparation. Sur EnterpriseOps Gym Hybrid, avec Gemma-4-26B-A4B-it comme cible et Qwen3.8-27B comme enseignant, 2 000 échantillons générés en environ 18 heures améliorent le Pass@1 moyen de 7,2 points, soit une hausse relative de 35 %, et le taux de succès du vérificateur passe de 63,01 % à 68,55 %. Sur ITSM, avec DeepSeek-V4.1-Flash comme enseignant, 1 994 échantillons générés en 66 heures font passer le Pass@1 moyen de 18,77 % à 27,18 %.

    Motif de la recommandation :L'article détaille un pipeline de génération de données d'entraînement pour agents d'entreprise, avec les critères de qualité et les résultats chiffrés sur deux domaines.

  1. Google DeepMind73

    Google DeepMind présente SynthID Bio, une technologie de filigrane pour les protéines générées par IA

    Google DeepMind présente SynthID Bio, une famille de méthodes de filigrane destinée à la biologie de synthèse.

    Motif de la recommandation :Le filigrane s'étend des médias numériques aux séquences protéiques, avec des données de laboratoire humide et une ouverture du code, ce qui permet de comprendre la vérification de la provenance des protéines générées par IA.

  1. Microsoft Research60

    Microsoft Research publie RetroChimera dans Nature pour améliorer la prédiction de synthèse des petites molécules

    Microsoft Research annonce la publication dans Nature de RetroChimera, un modèle de rétrosynthèse qui combine R-SMILES 2.

    Motif de la recommandation :L'article détaille l'architecture d'ensemble et le ré-ordonnancement appris de RetroChimera, ainsi que ses résultats en tests à l'aveugle, ce qui permet de juger de l'apport de la combinaison de deux modèles complémentaires.

  1. OpenAI News62

    OpenAI 提出 IH-Challenge 提升前沿 LLM 的指令层级

    OpenAI 发布 IH-Challenge, 用于训练模型优先执行可信指令, 从而改善指令层级, 安全可控性以及对提示注入攻击的抵抗能力.

    Motif de la recommandation :OpenAI 公开 IH-Challenge 训练思路, 说明如何让模型优先执行可信指令并提升抗提示注入能力.

  1. OpenAI News65

    GPT-5 réduit le coût de la synthèse de protéines sans cellules

    Un laboratoire autonome combinant GPT-5 d'OpenAI avec l'automatisation cloud de Ginkgo Bioworks a réduit de 40 % le coût de la synthèse de protéines sans cellules grâce à une expérimentation en boucle fermée.

    Motif de la recommandation :Un laboratoire autonome combinant GPT-5 et l'automatisation cloud de Ginkgo Bioworks réduit de 40 % le coût de la synthèse de protéines sans cellules.

  1. OpenAI News62

    OpenAI 发布 GPT-5.1-Codex-Max 系统卡

    OpenAI 发布 GPT-5.1-Codex-Max 系统卡, 说明该模型实施的安全措施. 系统卡涵盖模型层面的缓解手段, 包括针对有害任务和提示注入的专项安全训练, 以及产品层面的缓解手段, 如 agent 沙箱和可配置的网络访问.

    Motif de la recommandation :公开 GPT-5.1-Codex-Max 的安全措施细节, 包括针对有害任务与提示注入的专项训练及沙箱, 网络访问配置等产品级缓解手段.

  1. OpenAI News60

    OpenAI publie gpt-oss-safeguard-120b et gpt-oss-safeguard-20b

    OpenAI publie gpt-oss-safeguard-120b et gpt-oss-safeguard-20b。

    Motif de la recommandation :Deux modèles ouverts de raisonnement dédiés au marquage de contenu selon une politique fournie, avec évaluations de sécurité comparées aux gpt-oss de base.

  1. OpenAI News62

    OpenAI 推出 GDPval 评估, 衡量模型在真实工作任务上的表现

    OpenAI 推出 GDPval, 一项新的评估, 用于衡量模型在 44 种职业中具有真实经济价值的任务上的表现.

    Motif de la recommandation :OpenAI 公布 GDPval 评估, 覆盖 44 种职业的真实经济价值任务, 可用于对照模型在现实工作场景中的表现.