L'IA dépasse les experts-comptables agréés en vitesse et en précision, mais ne peut pas encore clôturer les comptes sans supervision
Une étude de Mercor montre que les modèles d'IA sont plus rapides.
Une étude de Mercor montre que les modèles d'IA sont plus rapides.
OpenAI a documenté de nouveaux cas de comportements inattendus de modèles en déploiement interne. Dans le cas le plus marquant.
Des chercheurs présentent une approche dite Image-to-Code dans laquelle un agent de codage écrit un programme Blender exécutable à partir d'une seule photo.
Dans un article invité publié par Anthropic, le physicien de Harvard Matthew Schwartz présente BootLoops.
Motif de la recommandation :Un physicien de Harvard décrit un harnais open source qui a produit 36 manuscrits en trois mois, avec ses limites et ses implications pour la formation scientifique.
Google a lancé le 1er octobre son prototype de satellite de calcul orbital à bord d'une fusée SpaceX depuis la Californie.
Ai2 (Allen Institute for AI) met en open source AstaBrief 8B, un modèle dérivé de Qwen3-8B qui transforme une question de recherche et des extraits de littérature en rapport cité.
Google annonce la prochaine génération de son système d'apprentissage fédéré (FL).
Motif de la recommandation :L'article détaille l'architecture TEE du nouveau système FL de Google et son déploiement sur Gboard, permettant de comprendre comment la vérifiabilité et l'auditabilité sont mises en œuvre.
ServiceNow CoreAI présente AutoSynthData, un pipeline qui transforme les échecs d'un modèle cible et les succès d'un enseignant plus fort en nouvelles tâches d'entraînement validées dans l'environnement. Le système génère des tâches composées d'une spécification système, d'un prompt utilisateur et d'un vérificateur, avec des contrôles de faisabilité, de réalisme et de difficulté, puis une vérification positive et négative et une phase de réparation. Sur EnterpriseOps Gym Hybrid, avec Gemma-4-26B-A4B-it comme cible et Qwen3.8-27B comme enseignant, 2 000 échantillons générés en environ 18 heures améliorent le Pass@1 moyen de 7,2 points, soit une hausse relative de 35 %, et le taux de succès du vérificateur passe de 63,01 % à 68,55 %. Sur ITSM, avec DeepSeek-V4.1-Flash comme enseignant, 1 994 échantillons générés en 66 heures font passer le Pass@1 moyen de 18,77 % à 27,18 %.
Motif de la recommandation :L'article détaille un pipeline de génération de données d'entraînement pour agents d'entreprise, avec les critères de qualité et les résultats chiffrés sur deux domaines.
NVIDIA ouvre les candidatures mondiales pour son Graduate Fellowship Program 2027-2028.
Un système d'apprentissage automatique développé lors d'un stage chez Microsoft Research prévoit les risques météorologiques spatiaux pour 66 935 sous-stations du réseau électrique continental américain, avec une alerte de 30 à 60 minutes avant l'impact. Le pipeline combine les prévisions des indices AE et Dst, la conductivité géologique locale et les données d'infrastructure, atteignant un RMSE de 410,2 nT pour l'AE et surpassant l'équation de Burton sur 62,2 % des heures lors des périodes les plus actives de 2020-2026. Il détecte 76,5 % des événements majeurs (≥10 nT/min), 81,2 % des événements sévères (≥20 nT/min) et 64,1 % des événements extrêmes (≥50 nT/min), avec des taux de fausses alertes croissant avec la sévérité.
Google DeepMind présente SynthID Bio, une famille de méthodes de filigrane destinée à la biologie de synthèse.
Motif de la recommandation :Le filigrane s'étend des médias numériques aux séquences protéiques, avec des données de laboratoire humide et une ouverture du code, ce qui permet de comprendre la vérification de la provenance des protéines générées par IA.
Hugging Face a lancé l'Open TTS Leaderboard, un classement qui évalue les modèles TTS open source et multilingues via des métriques objectives.
Google Research présente Diffusion Controller, un cadre qui reformule le processus de débruitage de la génération d'images comme un problème de contrôle continu.
Microsoft Research présente Quine, un effort de recherche combinant un modèle mondial multimodal de biologie et un harnais interactif reliant modèles.
Motif de la recommandation :Microsoft Research présente Quine, un modèle mondial multimodal de biologie couplé à un harnais, avec une validation en laboratoire humide sur le cancer du pancréas.
Hugging Face publie ProvenanceGuard, une couche de vérification post-génération pour les agents MCP qui distingue la source réelle de chaque affirmation au lieu de fusionner les preuves. Testé sur 281 traces d'un agent médical, il a détecté 138 des 139 affirmations jugées non valides par des experts et identifié la bonne source dans environ 86 % des cas. La méthode conserve l'identité des sources à travers décomposition, routage, scoring et réparation de type RARR, sans réentraîner l'agent.
Microsoft Research Asia – Singapore, premier laboratoire de recherche de Microsoft en Asie du Sud-Est.
OpenAI a publié ses premières lignes directrices sur les safety cases pour l'entraînement des IA de frontière。
Google Research présente un AI video co-director, un cadre multi-agents construit comme couche d'orchestration au-dessus de Gemini et Veo.
Motif de la recommandation :L'article détaille quatre cadres multi-agents pour la génération vidéo longue, avec les problèmes de dérive visuelle et de propagation d'erreurs qu'ils traitent.
NVIDIA rejoint une coalition incluant Google DeepMind et EMBL-EBI pour publier en accès libre les structures 3D prédites des complexes protéiques de plus de 2800 virus via la base AlphaFold. Les structures ont été inférées avec AlphaFold2 optimisé par NVIDIA BioNeMo Inference Runtime, et NVIDIA publie aussi le BioNeMo Structure Prediction Pipeline utilisé pour générer le jeu de données. Environ 30 % des interactions protéiques ajoutées sont totalement nouvelles pour la science, selon l'annonce.
Motif de la recommandation :NVIDIA et Google DeepMind ouvrent des structures protéiques virales prédites, un cas concret de données scientifiques partagées pour la préparation pandémique.
Microsoft Research publie une étude systématique montrant que déporter l'inférence d'IA physique hors du robot.
Motif de la recommandation :L'étude quantifie les gains de déport de l'inférence sur la réussite des tâches et l'autonomie des robots, avec un outillage Kubernetes open source associé.
OpenAI présente MentalHealthBench, un benchmark élaboré avec des experts pour évaluer le caractère utile et sûr des réponses d'IA dans des conversations réalistes de santé mentale. Le benchmark couvre des échanges concrets de ce domaine.
Le UK AI Security Institute (AISI) publie via l'infrastructure d'EvalEval des résultats d'évaluation vérifiés pour cinq benchmarks — HealthBench.
Microsoft Research annonce la publication dans Nature de RetroChimera, un modèle de rétrosynthèse qui combine R-SMILES 2.
Motif de la recommandation :L'article détaille l'architecture d'ensemble et le ré-ordonnancement appris de RetroChimera, ainsi que ses résultats en tests à l'aveugle, ce qui permet de juger de l'apport de la combinaison de deux modèles complémentaires.
OpenAI正在与一个独立的数学与人工智能顾问组合作, 为新兴AI成果的审查与传播提供指导. 该顾问组为独立性质, 其职责涵盖对AI相关结果的评审以及对外沟通环节. OpenAI未披露顾问组的成员构成, 具体审查流程或任何模型与版本信息.
Google Research introduit MilleMiglia, un générateur d'instances en C++ conçu pour créer des benchmarks réalistes pour les problèmes de livraison du middle mile.
Google Research présente une nouvelle expérience de recherche qui permet aux enseignants de créer des simulations éducatives interactives personnalisées.
OpenAI présente un cadre pour suivre, enquêter et divulguer le désalignement des modèles, accompagné de six rapports portant sur des comportements de modèle inattendus ou préoccupants.
Motif de la recommandation :Un cadre de suivi et de divulgation du désalignement des modèles, accompagné de six rapports de comportements inattendus, utile pour comprendre les pratiques de sécurité des modèles.
Une nouvelle étude d'OpenAI Economic Research montre comment les travailleurs utilisent l'IA au-delà de leurs rôles traditionnels et quelles nouvelles activités deviennent des parties récurrentes de leur travail.
Google Research présente Retrieve-for-Train, un cadre de compilation récompense-données qui remplace le budget de réflexion au moment de l'inférence par un entraînement RL hors ligne.
Google Research présente ToolGrad, une méthode « réponse d'abord » qui génère d'abord une chaîne d'utilisation d'outils de référence.
Le laboratoire de César de la Fuente utilise Codex et ChatGPT pour explorer des génomes d'organismes vivants et éteints afin d'identifier des candidats antimicrobiens contre les infections résistantes aux médicaments.
Google DeepMind présente AlphaGenome Atlas, une plateforme contenant les prédictions des effets de 9 milliards de variants mononucléotidiques.
Motif de la recommandation :Le texte détaille une ressource de 1 pétaoctet couvrant 9 milliards de variants et un score AVI unifié, ce qui permet de situer la portée pratique pour la recherche génomique.
Une étude Google Research évalue le transfer learning de GWAS européens (UK Biobank) vers la population japonaise (Biobank Japan.
Microsoft Research présente GigaPath-Flash et GigaTIME-Flash, deux modèles de fondation en pathologie dérivés de GigaPath et GigaTIME.
Motif de la recommandation :L'original expose les compromis efficacité-performance et les estimations de temps GPU, ce qui permet de juger si l'analyse à grande échelle devient réalisable.
Microsoft Research publie Skala 1.1, son functional DFT par deep-learning entraîné sur 2.
Microsoft Research présente MindTopo, un benchmark évaluant le raisonnement topologique des modèles multimodaux autour de cinq catégories.
Une recherche d'OpenAI montre comment les entreprises adoptent l'IA agentique via ChatGPT et Codex。
OpenAI partage de nouveaux résultats sur des problèmes ouverts de longue date en mathématiques et en informatique théorique, avec des avancées en géométrie, en cryptographie et en complexité.
OpenAI accorde à 100 000 chercheurs universitaires un accès gratuit aux modèles d'IA les plus avancés de ChatGPT, afin d'accélérer la recherche scientifique, la collaboration et les découvertes.
IBM Research et le Berkeley Sky Lab étendent K-Search, un framework de recherche évolutive de kernels piloté par LLM.
Motif de la recommandation :L'article détaille une couche de traduction CUDA vers MLX et les gains mesurés sur les kernels Attention et Mamba, utile pour évaluer la portabilité des optimisations GPU.