L'IA dépasse les experts-comptables agréés en vitesse et en précision, mais ne peut pas encore clôturer les comptes sans supervision
Une étude de Mercor montre que les modèles d'IA sont plus rapides.
Une étude de Mercor montre que les modèles d'IA sont plus rapides.
Dans un article invité publié par Anthropic, le physicien de Harvard Matthew Schwartz présente BootLoops.
Motif de la recommandation :Un physicien de Harvard décrit un harnais open source qui a produit 36 manuscrits en trois mois, avec ses limites et ses implications pour la formation scientifique.
Google annonce la prochaine génération de son système d'apprentissage fédéré (FL).
Motif de la recommandation :L'article détaille l'architecture TEE du nouveau système FL de Google et son déploiement sur Gboard, permettant de comprendre comment la vérifiabilité et l'auditabilité sont mises en œuvre.
ServiceNow CoreAI présente AutoSynthData, un pipeline qui transforme les échecs d'un modèle cible et les succès d'un enseignant plus fort en nouvelles tâches d'entraînement validées dans l'environnement. Le système génère des tâches composées d'une spécification système, d'un prompt utilisateur et d'un vérificateur, avec des contrôles de faisabilité, de réalisme et de difficulté, puis une vérification positive et négative et une phase de réparation. Sur EnterpriseOps Gym Hybrid, avec Gemma-4-26B-A4B-it comme cible et Qwen3.8-27B comme enseignant, 2 000 échantillons générés en environ 18 heures améliorent le Pass@1 moyen de 7,2 points, soit une hausse relative de 35 %, et le taux de succès du vérificateur passe de 63,01 % à 68,55 %. Sur ITSM, avec DeepSeek-V4.1-Flash comme enseignant, 1 994 échantillons générés en 66 heures font passer le Pass@1 moyen de 18,77 % à 27,18 %.
Motif de la recommandation :L'article détaille un pipeline de génération de données d'entraînement pour agents d'entreprise, avec les critères de qualité et les résultats chiffrés sur deux domaines.
Un système d'apprentissage automatique développé lors d'un stage chez Microsoft Research prévoit les risques météorologiques spatiaux pour 66 935 sous-stations du réseau électrique continental américain, avec une alerte de 30 à 60 minutes avant l'impact. Le pipeline combine les prévisions des indices AE et Dst, la conductivité géologique locale et les données d'infrastructure, atteignant un RMSE de 410,2 nT pour l'AE et surpassant l'équation de Burton sur 62,2 % des heures lors des périodes les plus actives de 2020-2026. Il détecte 76,5 % des événements majeurs (≥10 nT/min), 81,2 % des événements sévères (≥20 nT/min) et 64,1 % des événements extrêmes (≥50 nT/min), avec des taux de fausses alertes croissant avec la sévérité.
Google DeepMind présente SynthID Bio, une famille de méthodes de filigrane destinée à la biologie de synthèse.
Motif de la recommandation :Le filigrane s'étend des médias numériques aux séquences protéiques, avec des données de laboratoire humide et une ouverture du code, ce qui permet de comprendre la vérification de la provenance des protéines générées par IA.
OpenAI a publié ses premières lignes directrices sur les safety cases pour l'entraînement des IA de frontière。
Microsoft Research annonce la publication dans Nature de RetroChimera, un modèle de rétrosynthèse qui combine R-SMILES 2.
Motif de la recommandation :L'article détaille l'architecture d'ensemble et le ré-ordonnancement appris de RetroChimera, ainsi que ses résultats en tests à l'aveugle, ce qui permet de juger de l'apport de la combinaison de deux modèles complémentaires.
Google Research présente une nouvelle expérience de recherche qui permet aux enseignants de créer des simulations éducatives interactives personnalisées.
Une nouvelle étude d'OpenAI Economic Research montre comment les travailleurs utilisent l'IA au-delà de leurs rôles traditionnels et quelles nouvelles activités deviennent des parties récurrentes de leur travail.
Google Research présente Retrieve-for-Train, un cadre de compilation récompense-données qui remplace le budget de réflexion au moment de l'inférence par un entraînement RL hors ligne.
Google Research présente ToolGrad, une méthode « réponse d'abord » qui génère d'abord une chaîne d'utilisation d'outils de référence.
Une étude Google Research évalue le transfer learning de GWAS européens (UK Biobank) vers la population japonaise (Biobank Japan.
Une recherche d'OpenAI montre comment les entreprises adoptent l'IA agentique via ChatGPT et Codex。
OpenAI partage de nouveaux résultats sur des problèmes ouverts de longue date en mathématiques et en informatique théorique, avec des avancées en géométrie, en cryptographie et en complexité.
OpenAI的新研究显示, ChatGPT用户正在跨角色承担任务, 人工智能正在拓展工作者的工作范围并重塑岗位边界. 该研究基于ChatGPT用户的实际使用情况, 揭示了AI对职场分工的影响.
Berkeley AI Research présente ABBEL, un framework qui isole et supervise le contenu des résumés sous forme d'états de croyance en langage naturel.
OpenAI présente GeneBench-Pro, un nouveau benchmark évaluant les performances de l'IA en génomique。
Des chercheurs ont utilisé un modèle de raisonnement d'OpenAI pour aider au diagnostic de maladies rares, identifiant 18 nouveaux diagnostics dans des cas auparavant non résolus.
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家, 改进了药物制造中的一项关键反应, 推进了药物化学研究.
OpenAI présente LifeSciBench, un benchmark rédigé et révisé par des experts pour évaluer la manière dont les systèmes d'IA traitent des tâches et décisions réelles de recherche en sciences de la vie. Le benchmark couvre des tâches authentiques du domaine, avec une validation par des experts.
OpenAI 推出 Deployment Simulation, 一种在部署前预测 AI 模型行为的方法, 使用真实对话数据来提升安全性和评估准确性.
Motif de la recommandation :OpenAI 提出用真实对话数据在发布前模拟部署以预测模型行为, 为安全评估提供可迁移的方法思路.
OpenAI présente un cadre d'analyse couvrant 921 métiers et 148 millions d'emplois aux États-Unis pour identifier ceux exposés au risque d'automatisation。
Berkeley AI Research présente SPEX et ProxySPEX, des algorithmes d'attribution capables d'identifier les interactions influentes dans les LLM à une échelle bien supérieure aux méthodes antérieures. SPEX exploite la parcimonie et le faible degré des interactions pour reformuler la recherche exhaustive en un problème de recouvrement parcimonieux résolu via des outils de traitement du signal et de théorie du codage. ProxySPEX tire parti de la propriété de hiérarchie des modèles et atteint les performances de SPEX avec environ 10x moins d'ablations. Sur une tâche d'analyse de sentiment, SPEX conserve une fidélité élevée lorsque le contexte atteint des milliers de features, là où LIME et Banzhaf affichent une fidélité nettement inférieure.
OpenAI 发布 IH-Challenge, 用于训练模型优先执行可信指令, 从而改善指令层级, 安全可控性以及对提示注入攻击的抵抗能力.
Motif de la recommandation :OpenAI 公开 IH-Challenge 训练思路, 说明如何让模型优先执行可信指令并提升抗提示注入能力.
OpenAI 发布预印本, 展示 GPT-5.2 为胶子振幅提出一个新公式, 随后由 OpenAI 与学术合作者正式证明并验证.
Un laboratoire autonome combinant GPT-5 d'OpenAI avec l'automatisation cloud de Ginkgo Bioworks a réduit de 40 % le coût de la synthèse de protéines sans cellules grâce à une expérimentation en boucle fermée.
Motif de la recommandation :Un laboratoire autonome combinant GPT-5 et l'automatisation cloud de Ginkgo Bioworks réduit de 40 % le coût de la synthèse de protéines sans cellules.
Berkeley AI Research propose un cadre qui évalue et optimise directement les systèmes d'imagerie selon leur contenu informationnel.
OpenAI发布FrontierScience, 一个测试AI在物理, 化学和生物学领域推理能力的基准, 用于衡量AI在真实科学研究方面的进展.
OpenAI présente un cadre d'évaluation en conditions réelles pour mesurer comment l'IA peut accélérer la recherche biologique en laboratoire humide. GPT-5 a été utilisé pour optimiser un protocole de clonage moléculaire, explorant à la fois les promesses et les risques de l'expérimentation assistée par IA.
OpenAI présente les premiers cas de recherche montrant comment GPT-5 accélère les progrès scientifiques en mathématiques。
OpenAI présente IndQA, un nouveau benchmark destiné à évaluer les systèmes d'IA dans les langues indiennes. Conçu avec des experts du domaine。
OpenAI publie gpt-oss-safeguard-120b et gpt-oss-safeguard-20b。
Motif de la recommandation :Deux modèles ouverts de raisonnement dédiés au marquage de contenu selon une politique fournie, avec évaluations de sécurité comparées aux gpt-oss de base.
Apollo Research et OpenAI ont développé des évaluations pour la mauvaise alignement cachée。
Motif de la recommandation :OpenAI et Apollo Research présentent des évaluations du comportement de dissimulation et une méthode précoce pour le réduire, ce qui éclaire les risques d'alignement des modèles de pointe.
OpenAI a étudié les risques de frontière en pire cas liés à la publication de gpt-oss via une méthode de fine-tuning malveillant (MFT)。
OpenAI研究发现, 在错误回答上训练语言模型会导致更广泛的misalignment行为, 并识别出一个驱动该行为的内部特征, 通过极少量fine-tuning即可将其逆转. 该研究聚焦于错误训练数据引发misalignment泛化的机制, 为理解和预防此类问题提供了可操作的干预方向.
OpenAI发布HealthBench, 一个面向医疗领域AI模型的评估基准, 用于在贴近真实的场景中评测模型表现. 该基准在250余名医生的参与下构建, 目标是提供模型在健康领域性能与安全性的统一标准.
OpenAI 发布 MLE-bench, 一个用于衡量 AI agent 在机器学习工程任务中表现的基准. 该基准的评估对象是 AI agent 的机器学习工程能力, 而非单纯的模型推理或编码能力.
OpenAI présente des techniques d'entraînement améliorées pour les Consistency Models。
OpenAI a identifié automatiquement 16 millions de motifs dans les calculs de GPT-4 en utilisant de nouvelles techniques de mise à l'échelle des autoencodeurs parcimonieux. Cette méthode permet d'extraire des concepts du modèle.