OpenAI 与 Molecule.one 展示近自主 AI 化学家改进药物合成反应
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家, 改进了药物制造中的一项关键反应, 推进了药物化学研究.
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家, 改进了药物制造中的一项关键反应, 推进了药物化学研究.
OpenAI présente LifeSciBench, un benchmark rédigé et révisé par des experts pour évaluer la manière dont les systèmes d'IA traitent des tâches et décisions réelles de recherche en sciences de la vie. Le benchmark couvre des tâches authentiques du domaine, avec une validation par des experts.
Google Research publie un jeu de données vectorisées qui transforme les cartes haute résolution des haies。
Google DeepMind présente son AI Control Roadmap, un cadre de défense en profondeur qui traite les agents internes comme potentiellement mal alignés et ajoute une couche de sécurité système au-delà de l'alignement des modèles. Le dispositif s'appuie sur un cadre de modélisation des menaces inspiré de MITRE ATT&CK, des superviseurs IA surveillant le raisonnement et les actions des agents, et des niveaux de détection D1-D4 et de prévention/réponse R1-R3 indexés sur les capacités du modèle. L'équipe indique avoir analysé un million de tâches d'agents de codage et utilisé ces données pour un moniteur en direct du agent Gemini Spark, la majorité des événements signalés provenant de mauvaises interprétations plutôt que d'une intention adverse. DeepMind publie en parallèle un cadre technique pour les décideurs, 'Three Layers of Agent Security'.
Motif de la recommandation :Google DeepMind détaille son AI Control Roadmap et les niveaux D1-D4/R1-R3, une grille de sécurité des agents directement transposable à d'autres déploiements.
OpenAI 推出 Deployment Simulation, 一种在部署前预测 AI 模型行为的方法, 使用真实对话数据来提升安全性和评估准确性.
Motif de la recommandation :OpenAI 提出用真实对话数据在发布前模拟部署以预测模型行为, 为安全评估提供可迁移的方法思路.
Google Research publie dans JAMA Dermatology une étude montrant que l'assistance par IA fait passer la précision d'identification des affections cutanées de 8 % (recherche web classique) à 23 %, et à 36 % lorsque les prédictions correspondent aux diagnostics de référence de dermatologues. Menée auprès de 2 345 participants, l'étude révèle aussi que l'IA n'améliore pas significativement la détermination des étapes suivantes : 30 % des utilisateurs du bras IA suggèrent une prise en charge moins urgente que celle d'un dermatologue, contre 27 % dans le groupe contrôle. Un second volet qualitatif examine l'usage de ces outils sur des cas personnels au sein de communautés diverses.
Google Research présente Regularized f-Divergence Kernel Tests, un cadre d'audit du machine unlearning dévoilé à AISTATS 2026。
Google DeepMind, avec Schmidt Sciences, la Cooperative AI Foundation, l'ARIA et le soutien de Google.org。
Google DeepMind publie les résultats d'un essai contrôlé randomisé pré-enregistré mené en Sierra Leone sur Guided Learning。
Motif de la recommandation :L'essai contrôlé randomisé pré-enregistré en Sierra Leone fournit des chiffres d'effet et des données d'interaction, utiles pour évaluer l'usage pédagogique de l'IA.
OpenAI lance l'Economic Research Exchange, un programme destiné à étudier l'impact de l'IA sur l'emploi。
Google Research présente PHRM, un système de recherche qui utilise la caméra frontale du smartphone pour capturer des vidéos du visage après le déverrouillage et estime la fréquence cardiaque par photopléthysmographie à distance et apprentissage profond, avec une MAPE inférieure à 10 % par rapport à l'électrocardiogramme. Le système agrège les mesures de la journée pour estimer la fréquence cardiaque au repos quotidienne, avec une MAE inférieure à 5 bpm par rapport aux objets portables. L'étude s'appuie sur plus de 350 000 clips vidéo de près de 700 participants, en veillant à la représentation des différents tons de peau, et publie le plus grand ensemble de données vidéo de smartphone disponible pour la recherche ainsi qu'un modèle pré-entraîné PHRM-mini.
Motif de la recommandation :Le système PHRM utilise la caméra frontale du téléphone pour surveiller en arrière-plan la fréquence cardiaque et la fréquence cardiaque au repos, avec une précision proche de celle des objets portables, et publie le plus grand ensemble de données diversifié à ce jour.
Mistral a présenté lors de l'AI Now Summit une pile IA intégrée pour l'ingénierie industrielle。
Motif de la recommandation :Mistral détaille sa pile IA industrielle et son agent Vibe, avec des partenariats Airbus, BMW et ASML et un centre de données en France, ce qui éclaire le positionnement entreprise.
Google Research présente une nouvelle méthode d'agrégation cryptographique pour l'analyse privée。
Un modèle d'OpenAI a résolu le problème des distances unitaires, vieux de 80 ans。
Motif de la recommandation :Un modèle d'OpenAI résout le problème des distances unitaires vieux de 80 ans et réfute une conjecture centrale en géométrie discrète, un cas concret de raisonnement mathématique par IA.
Google DeepMind présente l'utilisation de Co-Scientist par les biologistes Omar Abudayyeh et Jonathan Gootenberg pour accélérer la recherche sur le vieillissement cellulaire. L'outil a analysé des dizaines de milliers d'articles et proposé plus de 20 facteurs génétiques nouveaux et plausibles à tester ; des tests en laboratoire ont validé quelques hypothèses, les facteurs recommandés ayant conduit les cellules vers un état plus jeune avec une fonction globale améliorée. Co-Scientist réduit aussi le temps d'analyse des données de criblage, qui pouvait prendre jusqu'à six mois, à quelques jours seulement.
Motif de la recommandation :L'original montre comment Co-Scientist propose des cibles génétiques et réduit de six mois à quelques jours l'analyse de criblage, une méthode transférable à d'autres équipes.
Parameter Golf a réuni plus de 1 000 participants et 2 000 soumissions pour explorer la recherche en machine learning assistée par IA。
Adaptive Parallel Reasoning permet à un modèle de raisonnement de décider lui-même quand décomposer et paralléliser des sous-tâches indépendantes.
OpenAI publie sa recherche B2B Signals montrant que les entreprises de pointe approfondissent leur adoption de l'IA et passent à l'échelle des workflows agentiques propulsés par Codex. Ces organisations construisent ainsi un avantage concurrentiel durable face aux autres entreprises.
OpenAI présente un cadre d'analyse couvrant 921 métiers et 148 millions d'emplois aux États-Unis pour identifier ceux exposés au risque d'automatisation。
GRASP est un nouveau planificateur à base de gradients pour les world models appris.
OpenAI explique comment elle utilise la surveillance par chaîne de pensée pour étudier les mésalignements de ses agents de codage internes. L'approche analyse des déploiements réels afin de détecter les risques et de renforcer les garde-fous de sûreté de l'IA.
Berkeley AI Research présente SPEX et ProxySPEX, des algorithmes d'attribution capables d'identifier les interactions influentes dans les LLM à une échelle bien supérieure aux méthodes antérieures. SPEX exploite la parcimonie et le faible degré des interactions pour reformuler la recherche exhaustive en un problème de recouvrement parcimonieux résolu via des outils de traitement du signal et de théorie du codage. ProxySPEX tire parti de la propriété de hiérarchie des modèles et atteint les performances de SPEX avec environ 10x moins d'ablations. Sur une tâche d'analyse de sentiment, SPEX conserve une fidélité élevée lorsque le contexte atteint des milliers de features, là où LIME et Banzhaf affichent une fidélité nettement inférieure.
OpenAI détaille comment ChatGPT se défend contre l'injection de prompt et l'ingénierie sociale en contraignant les actions risquées et en protégeant les données sensibles dans les workflows agentiques. L'approche repose sur la limitation des actions à risque et la protection des données sensibles au sein des flux d'agents.
OpenAI 发布 IH-Challenge, 用于训练模型优先执行可信指令, 从而改善指令层级, 安全可控性以及对提示注入攻击的抵抗能力.
Motif de la recommandation :OpenAI 公开 IH-Challenge 训练思路, 说明如何让模型优先执行可信指令并提升抗提示注入能力.
OpenAI présente CoT-Control et constate que les modèles de raisonnement contrôlent difficilement leur chaîne de pensée, ce qui renforce la surveillabilité comme garde-fou de sécurité de l'IA.
Un nouveau preprint étend les amplitudes single-minus aux gravitons, GPT-5.2 Pro ayant contribué à dériver et vérifier des amplitudes d'arbre de gravitons non nulles en gravité quantique.
Pacific Northwest National Laboratory et OpenAI lancent DraftNEPABench, un benchmark évaluant comment les agents de codage IA peuvent accélérer les permis fédéraux。
OpenAI publie les tentatives de preuve de son modèle d'IA pour le défi mathématique First Proof。
OpenAI et Paradigm présentent EVMbench, un benchmark qui évalue la capacité des agents IA à détecter, corriger et exploiter des vulnérabilités critiques de smart contracts.
OpenAI 发布预印本, 展示 GPT-5.2 为胶子振幅提出一个新公式, 随后由 OpenAI 与学术合作者正式证明并验证.
OpenAI publie GABRIEL, une nouvelle boîte à outils open source qui s'appuie sur GPT pour transformer des textes et des images qualitatifs en données quantitatives. Elle vise à aider les chercheurs en sciences sociales à analyser leurs corpus à grande échelle.
Un laboratoire autonome combinant GPT-5 d'OpenAI avec l'automatisation cloud de Ginkgo Bioworks a réduit de 40 % le coût de la synthèse de protéines sans cellules grâce à une expérimentation en boucle fermée.
Motif de la recommandation :Un laboratoire autonome combinant GPT-5 et l'automatisation cloud de Ginkgo Bioworks réduit de 40 % le coût de la synthèse de protéines sans cellules.
Berkeley AI Research propose un cadre qui évalue et optimise directement les systèmes d'imagerie selon leur contenu informationnel.
OpenAI推出面向思维链可监控性的新框架与评估套件, 覆盖24种环境下的13项评估. 其结果显示, 监控模型内部推理远比仅监控输出更有效, 为AI系统能力提升后的可扩展控制提供了一条有前景的路径.
OpenAI发布FrontierScience, 一个测试AI在物理, 化学和生物学领域推理能力的基准, 用于衡量AI在真实科学研究方面的进展.
OpenAI présente un cadre d'évaluation en conditions réelles pour mesurer comment l'IA peut accélérer la recherche biologique en laboratoire humide. GPT-5 a été utilisé pour optimiser un protocole de clonage moléculaire, explorant à la fois les promesses et les risques de l'expérimentation assistée par IA.
Des chercheurs d'OpenAI testent les « confessions »。
Le professeur Ernest Ryu de l'UCLA et GPT-5 ont résolu une question clé en théorie de l'optimisation, illustrant le rôle de l'IA dans l'accélération de la découverte mathématique.
OpenAI présente les premiers cas de recherche montrant comment GPT-5 accélère les progrès scientifiques en mathématiques。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡, 说明该模型实施的安全措施. 系统卡涵盖模型层面的缓解手段, 包括针对有害任务和提示注入的专项安全训练, 以及产品层面的缓解手段, 如 agent 沙箱和可配置的网络访问.
Motif de la recommandation :公开 GPT-5.1-Codex-Max 的安全措施细节, 包括针对有害任务与提示注入的专项训练及沙箱, 网络访问配置等产品级缓解手段.