Des chercheurs présentent une approche dite Image-to-Code dans laquelle un agent de codage écrit un programme Blender exécutable à partir d'une seule photo.
ServiceNow CoreAI présente AutoSynthData, un pipeline qui transforme les échecs d'un modèle cible et les succès d'un enseignant plus fort en nouvelles tâches d'entraînement validées dans l'environnement. Le système génère des tâches composées d'une spécification système, d'un prompt utilisateur et d'un vérificateur, avec des contrôles de faisabilité, de réalisme et de difficulté, puis une vérification positive et négative et une phase de réparation. Sur EnterpriseOps Gym Hybrid, avec Gemma-4-26B-A4B-it comme cible et Qwen3.8-27B comme enseignant, 2 000 échantillons générés en environ 18 heures améliorent le Pass@1 moyen de 7,2 points, soit une hausse relative de 35 %, et le taux de succès du vérificateur passe de 63,01 % à 68,55 %. Sur ITSM, avec DeepSeek-V4.1-Flash comme enseignant, 1 994 échantillons générés en 66 heures font passer le Pass@1 moyen de 18,77 % à 27,18 %.
Motif de la recommandation :L'article détaille un pipeline de génération de données d'entraînement pour agents d'entreprise, avec les critères de qualité et les résultats chiffrés sur deux domaines.
Hugging Face publie ProvenanceGuard, une couche de vérification post-génération pour les agents MCP qui distingue la source réelle de chaque affirmation au lieu de fusionner les preuves. Testé sur 281 traces d'un agent médical, il a détecté 138 des 139 affirmations jugées non valides par des experts et identifié la bonne source dans environ 86 % des cas. La méthode conserve l'identité des sources à travers décomposition, routage, scoring et réparation de type RARR, sans réentraîner l'agent.
Motif de la recommandation :L'article détaille quatre cadres multi-agents pour la génération vidéo longue, avec les problèmes de dérive visuelle et de propagation d'erreurs qu'ils traitent.
OpenAI explique comment elle utilise la surveillance par chaîne de pensée pour étudier les mésalignements de ses agents de codage internes. L'approche analyse des déploiements réels afin de détecter les risques et de renforcer les garde-fous de sûreté de l'IA.
OpenAI détaille comment ChatGPT se défend contre l'injection de prompt et l'ingénierie sociale en contraignant les actions risquées et en protégeant les données sensibles dans les workflows agentiques. L'approche repose sur la limitation des actions à risque et la protection des données sensibles au sein des flux d'agents.
Pacific Northwest National Laboratory et OpenAI lancent DraftNEPABench, un benchmark évaluant comment les agents de codage IA peuvent accélérer les permis fédéraux。
OpenAI et Paradigm présentent EVMbench, un benchmark qui évalue la capacité des agents IA à détecter, corriger et exploiter des vulnérabilités critiques de smart contracts.
OpenAI publie BrowseComp, un benchmark destiné à évaluer les agents de navigation. Le contenu détaillé du benchmark, ses métriques et ses résultats ne sont pas précisés dans le texte source.
OpenAI présente PaperBench, un benchmark qui évalue la capacité des agents IA à reproduire de la recherche de pointe en IA. Le benchmark mesure si ces agents peuvent répliquer des travaux de recherche publiés, sans précision sur les modèles testés ni les scores obtenus.