L'IA dépasse les experts-comptables agréés en vitesse et en précision, mais ne peut pas encore clôturer les comptes sans supervision
Une étude de Mercor montre que les modèles d'IA sont plus rapides.
Une étude de Mercor montre que les modèles d'IA sont plus rapides.
Des chercheurs présentent une approche dite Image-to-Code dans laquelle un agent de codage écrit un programme Blender exécutable à partir d'une seule photo.
Dans un article invité publié par Anthropic, le physicien de Harvard Matthew Schwartz présente BootLoops.
Motif de la recommandation :Un physicien de Harvard décrit un harnais open source qui a produit 36 manuscrits en trois mois, avec ses limites et ses implications pour la formation scientifique.
Google annonce la prochaine génération de son système d'apprentissage fédéré (FL).
Motif de la recommandation :L'article détaille l'architecture TEE du nouveau système FL de Google et son déploiement sur Gboard, permettant de comprendre comment la vérifiabilité et l'auditabilité sont mises en œuvre.
ServiceNow CoreAI présente AutoSynthData, un pipeline qui transforme les échecs d'un modèle cible et les succès d'un enseignant plus fort en nouvelles tâches d'entraînement validées dans l'environnement. Le système génère des tâches composées d'une spécification système, d'un prompt utilisateur et d'un vérificateur, avec des contrôles de faisabilité, de réalisme et de difficulté, puis une vérification positive et négative et une phase de réparation. Sur EnterpriseOps Gym Hybrid, avec Gemma-4-26B-A4B-it comme cible et Qwen3.8-27B comme enseignant, 2 000 échantillons générés en environ 18 heures améliorent le Pass@1 moyen de 7,2 points, soit une hausse relative de 35 %, et le taux de succès du vérificateur passe de 63,01 % à 68,55 %. Sur ITSM, avec DeepSeek-V4.1-Flash comme enseignant, 1 994 échantillons générés en 66 heures font passer le Pass@1 moyen de 18,77 % à 27,18 %.
Motif de la recommandation :L'article détaille un pipeline de génération de données d'entraînement pour agents d'entreprise, avec les critères de qualité et les résultats chiffrés sur deux domaines.
Un système d'apprentissage automatique développé lors d'un stage chez Microsoft Research prévoit les risques météorologiques spatiaux pour 66 935 sous-stations du réseau électrique continental américain, avec une alerte de 30 à 60 minutes avant l'impact. Le pipeline combine les prévisions des indices AE et Dst, la conductivité géologique locale et les données d'infrastructure, atteignant un RMSE de 410,2 nT pour l'AE et surpassant l'équation de Burton sur 62,2 % des heures lors des périodes les plus actives de 2020-2026. Il détecte 76,5 % des événements majeurs (≥10 nT/min), 81,2 % des événements sévères (≥20 nT/min) et 64,1 % des événements extrêmes (≥50 nT/min), avec des taux de fausses alertes croissant avec la sévérité.
Google DeepMind présente SynthID Bio, une famille de méthodes de filigrane destinée à la biologie de synthèse.
Motif de la recommandation :Le filigrane s'étend des médias numériques aux séquences protéiques, avec des données de laboratoire humide et une ouverture du code, ce qui permet de comprendre la vérification de la provenance des protéines générées par IA.
Hugging Face a lancé l'Open TTS Leaderboard, un classement qui évalue les modèles TTS open source et multilingues via des métriques objectives.
Google Research présente Diffusion Controller, un cadre qui reformule le processus de débruitage de la génération d'images comme un problème de contrôle continu.
Hugging Face publie ProvenanceGuard, une couche de vérification post-génération pour les agents MCP qui distingue la source réelle de chaque affirmation au lieu de fusionner les preuves. Testé sur 281 traces d'un agent médical, il a détecté 138 des 139 affirmations jugées non valides par des experts et identifié la bonne source dans environ 86 % des cas. La méthode conserve l'identité des sources à travers décomposition, routage, scoring et réparation de type RARR, sans réentraîner l'agent.
OpenAI a publié ses premières lignes directrices sur les safety cases pour l'entraînement des IA de frontière。
Google Research présente un AI video co-director, un cadre multi-agents construit comme couche d'orchestration au-dessus de Gemini et Veo.
Motif de la recommandation :L'article détaille quatre cadres multi-agents pour la génération vidéo longue, avec les problèmes de dérive visuelle et de propagation d'erreurs qu'ils traitent.
Microsoft Research publie une étude systématique montrant que déporter l'inférence d'IA physique hors du robot.
Motif de la recommandation :L'étude quantifie les gains de déport de l'inférence sur la réussite des tâches et l'autonomie des robots, avec un outillage Kubernetes open source associé.
OpenAI présente MentalHealthBench, un benchmark élaboré avec des experts pour évaluer le caractère utile et sûr des réponses d'IA dans des conversations réalistes de santé mentale. Le benchmark couvre des échanges concrets de ce domaine.
Microsoft Research annonce la publication dans Nature de RetroChimera, un modèle de rétrosynthèse qui combine R-SMILES 2.
Motif de la recommandation :L'article détaille l'architecture d'ensemble et le ré-ordonnancement appris de RetroChimera, ainsi que ses résultats en tests à l'aveugle, ce qui permet de juger de l'apport de la combinaison de deux modèles complémentaires.
Google Research introduit MilleMiglia, un générateur d'instances en C++ conçu pour créer des benchmarks réalistes pour les problèmes de livraison du middle mile.
Google Research présente une nouvelle expérience de recherche qui permet aux enseignants de créer des simulations éducatives interactives personnalisées.
Une nouvelle étude d'OpenAI Economic Research montre comment les travailleurs utilisent l'IA au-delà de leurs rôles traditionnels et quelles nouvelles activités deviennent des parties récurrentes de leur travail.
Google Research présente Retrieve-for-Train, un cadre de compilation récompense-données qui remplace le budget de réflexion au moment de l'inférence par un entraînement RL hors ligne.
Google Research présente ToolGrad, une méthode « réponse d'abord » qui génère d'abord une chaîne d'utilisation d'outils de référence.
Une étude Google Research évalue le transfer learning de GWAS européens (UK Biobank) vers la population japonaise (Biobank Japan.
Microsoft Research présente MindTopo, un benchmark évaluant le raisonnement topologique des modèles multimodaux autour de cinq catégories.
Une recherche d'OpenAI montre comment les entreprises adoptent l'IA agentique via ChatGPT et Codex。
OpenAI partage de nouveaux résultats sur des problèmes ouverts de longue date en mathématiques et en informatique théorique, avec des avancées en géométrie, en cryptographie et en complexité.
IBM Research et le Berkeley Sky Lab étendent K-Search, un framework de recherche évolutive de kernels piloté par LLM.
Motif de la recommandation :L'article détaille une couche de traduction CUDA vers MLX et les gains mesurés sur les kernels Attention et Mamba, utile pour évaluer la portabilité des optimisations GPU.
OpenAI的新研究显示, ChatGPT用户正在跨角色承担任务, 人工智能正在拓展工作者的工作范围并重塑岗位边界. 该研究基于ChatGPT用户的实际使用情况, 揭示了AI对职场分工的影响.
Berkeley AI Research présente ABBEL, un framework qui isole et supervise le contenu des résumés sous forme d'états de croyance en langage naturel.
OpenAI présente GPT-Red, un système de red teaming automatisé qui utilise le self-play pour améliorer la sécurité, l'alignement et la robustesse face aux injections de prompt.
Une nouvelle analyse d'OpenAI révèle des problèmes dans SWE-Bench Pro, un benchmark de code populaire, remettant en cause la fiabilité et la précision de l'évaluation des modèles d'IA.
OpenAI présente GeneBench-Pro, un nouveau benchmark évaluant les performances de l'IA en génomique。
OpenAI发布的一项新研究论文显示, AI agents正在改变工作方式, 能够执行更长, 更复杂的任务, 并提升各类岗位的生产力.
Des chercheurs ont utilisé un modèle de raisonnement d'OpenAI pour aider au diagnostic de maladies rares, identifiant 18 nouveaux diagnostics dans des cas auparavant non résolus.
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家, 改进了药物制造中的一项关键反应, 推进了药物化学研究.
OpenAI présente LifeSciBench, un benchmark rédigé et révisé par des experts pour évaluer la manière dont les systèmes d'IA traitent des tâches et décisions réelles de recherche en sciences de la vie. Le benchmark couvre des tâches authentiques du domaine, avec une validation par des experts.
OpenAI 推出 Deployment Simulation, 一种在部署前预测 AI 模型行为的方法, 使用真实对话数据来提升安全性和评估准确性.
Motif de la recommandation :OpenAI 提出用真实对话数据在发布前模拟部署以预测模型行为, 为安全评估提供可迁移的方法思路.
Adaptive Parallel Reasoning permet à un modèle de raisonnement de décider lui-même quand décomposer et paralléliser des sous-tâches indépendantes.
OpenAI publie sa recherche B2B Signals montrant que les entreprises de pointe approfondissent leur adoption de l'IA et passent à l'échelle des workflows agentiques propulsés par Codex. Ces organisations construisent ainsi un avantage concurrentiel durable face aux autres entreprises.
OpenAI présente un cadre d'analyse couvrant 921 métiers et 148 millions d'emplois aux États-Unis pour identifier ceux exposés au risque d'automatisation。
GRASP est un nouveau planificateur à base de gradients pour les world models appris.
OpenAI explique comment elle utilise la surveillance par chaîne de pensée pour étudier les mésalignements de ses agents de codage internes. L'approche analyse des déploiements réels afin de détecter les risques et de renforcer les garde-fous de sûreté de l'IA.