OpenAI : le calcul scientifique à l'ère de l'IA agentique
Un nouveau field report d'OpenAI montre comment les scientifiques utilisent des agents de codage IA pour moderniser le calcul scientifique。
Un nouveau field report d'OpenAI montre comment les scientifiques utilisent des agents de codage IA pour moderniser le calcul scientifique。
OpenAI的新研究显示, ChatGPT用户正在跨角色承担任务, 人工智能正在拓展工作者的工作范围并重塑岗位边界. 该研究基于ChatGPT用户的实际使用情况, 揭示了AI对职场分工的影响.
Berkeley AI Research présente ABBEL, un framework qui isole et supervise le contenu des résumés sous forme d'états de croyance en langage naturel.
OpenAI与美国能源部及国家实验室合作, 利用前沿AI加速科学发现, 并阐述了其推进美国科学的承诺. 该合作旨在将前沿AI应用于科研探索, 以加快发现进程.
OpenAI présente GPT-Red, un système de red teaming automatisé qui utilise le self-play pour améliorer la sécurité, l'alignement et la robustesse face aux injections de prompt.
Une nouvelle analyse d'OpenAI révèle des problèmes dans SWE-Bench Pro, un benchmark de code populaire, remettant en cause la fiabilité et la précision de l'évaluation des modèles d'IA.
Aditya G. Parameswaran (UC Berkeley) et ses collaborateurs identifient trois défis pour les data systems à l'ère de l'inférence quasi gratuite.
Le Berkeley Artificial Intelligence Research (BAIR) Lab a mis à l'honneur sa promotion 2026 de docteurs en IA et machine learning.
OpenAI présente GeneBench-Pro, un nouveau benchmark évaluant les performances de l'IA en génomique。
OpenAI发布的一项新研究论文显示, AI agents正在改变工作方式, 能够执行更长, 更复杂的任务, 并提升各类岗位的生产力.
GPT-5 Pro a aidé à résoudre une énigme d'immunologie vieille de 3 ans。
Des chercheurs ont utilisé un modèle de raisonnement d'OpenAI pour aider au diagnostic de maladies rares, identifiant 18 nouveaux diagnostics dans des cas auparavant non résolus.
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家, 改进了药物制造中的一项关键反应, 推进了药物化学研究.
OpenAI présente LifeSciBench, un benchmark rédigé et révisé par des experts pour évaluer la manière dont les systèmes d'IA traitent des tâches et décisions réelles de recherche en sciences de la vie. Le benchmark couvre des tâches authentiques du domaine, avec une validation par des experts.
OpenAI 推出 Deployment Simulation, 一种在部署前预测 AI 模型行为的方法, 使用真实对话数据来提升安全性和评估准确性.
Motif de la recommandation :OpenAI 提出用真实对话数据在发布前模拟部署以预测模型行为, 为安全评估提供可迁移的方法思路.
OpenAI lance l'Economic Research Exchange, un programme destiné à étudier l'impact de l'IA sur l'emploi。
Un modèle d'OpenAI a résolu le problème des distances unitaires, vieux de 80 ans。
Motif de la recommandation :Un modèle d'OpenAI résout le problème des distances unitaires vieux de 80 ans et réfute une conjecture centrale en géométrie discrète, un cas concret de raisonnement mathématique par IA.
Parameter Golf a réuni plus de 1 000 participants et 2 000 soumissions pour explorer la recherche en machine learning assistée par IA。
Adaptive Parallel Reasoning permet à un modèle de raisonnement de décider lui-même quand décomposer et paralléliser des sous-tâches indépendantes.
OpenAI publie sa recherche B2B Signals montrant que les entreprises de pointe approfondissent leur adoption de l'IA et passent à l'échelle des workflows agentiques propulsés par Codex. Ces organisations construisent ainsi un avantage concurrentiel durable face aux autres entreprises.
OpenAI présente un cadre d'analyse couvrant 921 métiers et 148 millions d'emplois aux États-Unis pour identifier ceux exposés au risque d'automatisation。
GRASP est un nouveau planificateur à base de gradients pour les world models appris.
OpenAI explique comment elle utilise la surveillance par chaîne de pensée pour étudier les mésalignements de ses agents de codage internes. L'approche analyse des déploiements réels afin de détecter les risques et de renforcer les garde-fous de sûreté de l'IA.
Berkeley AI Research présente SPEX et ProxySPEX, des algorithmes d'attribution capables d'identifier les interactions influentes dans les LLM à une échelle bien supérieure aux méthodes antérieures. SPEX exploite la parcimonie et le faible degré des interactions pour reformuler la recherche exhaustive en un problème de recouvrement parcimonieux résolu via des outils de traitement du signal et de théorie du codage. ProxySPEX tire parti de la propriété de hiérarchie des modèles et atteint les performances de SPEX avec environ 10x moins d'ablations. Sur une tâche d'analyse de sentiment, SPEX conserve une fidélité élevée lorsque le contexte atteint des milliers de features, là où LIME et Banzhaf affichent une fidélité nettement inférieure.
OpenAI détaille comment ChatGPT se défend contre l'injection de prompt et l'ingénierie sociale en contraignant les actions risquées et en protégeant les données sensibles dans les workflows agentiques. L'approche repose sur la limitation des actions à risque et la protection des données sensibles au sein des flux d'agents.
OpenAI 发布 IH-Challenge, 用于训练模型优先执行可信指令, 从而改善指令层级, 安全可控性以及对提示注入攻击的抵抗能力.
Motif de la recommandation :OpenAI 公开 IH-Challenge 训练思路, 说明如何让模型优先执行可信指令并提升抗提示注入能力.
OpenAI présente CoT-Control et constate que les modèles de raisonnement contrôlent difficilement leur chaîne de pensée, ce qui renforce la surveillabilité comme garde-fou de sécurité de l'IA.
Un nouveau preprint étend les amplitudes single-minus aux gravitons, GPT-5.2 Pro ayant contribué à dériver et vérifier des amplitudes d'arbre de gravitons non nulles en gravité quantique.
Pacific Northwest National Laboratory et OpenAI lancent DraftNEPABench, un benchmark évaluant comment les agents de codage IA peuvent accélérer les permis fédéraux。
OpenAI publie les tentatives de preuve de son modèle d'IA pour le défi mathématique First Proof。
OpenAI et Paradigm présentent EVMbench, un benchmark qui évalue la capacité des agents IA à détecter, corriger et exploiter des vulnérabilités critiques de smart contracts.
OpenAI 发布预印本, 展示 GPT-5.2 为胶子振幅提出一个新公式, 随后由 OpenAI 与学术合作者正式证明并验证.
OpenAI publie GABRIEL, une nouvelle boîte à outils open source qui s'appuie sur GPT pour transformer des textes et des images qualitatifs en données quantitatives. Elle vise à aider les chercheurs en sciences sociales à analyser leurs corpus à grande échelle.
Un laboratoire autonome combinant GPT-5 d'OpenAI avec l'automatisation cloud de Ginkgo Bioworks a réduit de 40 % le coût de la synthèse de protéines sans cellules grâce à une expérimentation en boucle fermée.
Motif de la recommandation :Un laboratoire autonome combinant GPT-5 et l'automatisation cloud de Ginkgo Bioworks réduit de 40 % le coût de la synthèse de protéines sans cellules.
Berkeley AI Research propose un cadre qui évalue et optimise directement les systèmes d'imagerie selon leur contenu informationnel.
OpenAI推出面向思维链可监控性的新框架与评估套件, 覆盖24种环境下的13项评估. 其结果显示, 监控模型内部推理远比仅监控输出更有效, 为AI系统能力提升后的可扩展控制提供了一条有前景的路径.
OpenAI发布FrontierScience, 一个测试AI在物理, 化学和生物学领域推理能力的基准, 用于衡量AI在真实科学研究方面的进展.
OpenAI présente un cadre d'évaluation en conditions réelles pour mesurer comment l'IA peut accélérer la recherche biologique en laboratoire humide. GPT-5 a été utilisé pour optimiser un protocole de clonage moléculaire, explorant à la fois les promesses et les risques de l'expérimentation assistée par IA.
Des chercheurs d'OpenAI testent les « confessions »。
Le professeur Ernest Ryu de l'UCLA et GPT-5 ont résolu une question clé en théorie de l'optimisation, illustrant le rôle de l'IA dans l'accélération de la découverte mathématique.