Amazon SageMaker AI MTRL : fine-tuner un agent de recherche par RL multi-tours
Amazon SageMaker AI permet de fine-tuner un agent de recherche par apprentissage par renforcement multi-tours (MTRL).
Amazon SageMaker AI permet de fine-tuner un agent de recherche par apprentissage par renforcement multi-tours (MTRL).
GitHub identifie trois compétences clés pour les développeurs à l'ère de l'IA : apprendre à diriger les agents IA plutôt que simplement les utiliser.
ServiceNow CoreAI présente AutoSynthData, un pipeline qui transforme les échecs d'un modèle cible et les succès d'un enseignant plus fort en nouvelles tâches d'entraînement validées dans l'environnement. Le système génère des tâches composées d'une spécification système, d'un prompt utilisateur et d'un vérificateur, avec des contrôles de faisabilité, de réalisme et de difficulté, puis une vérification positive et négative et une phase de réparation. Sur EnterpriseOps Gym Hybrid, avec Gemma-4-26B-A4B-it comme cible et Qwen3.8-27B comme enseignant, 2 000 échantillons générés en environ 18 heures améliorent le Pass@1 moyen de 7,2 points, soit une hausse relative de 35 %, et le taux de succès du vérificateur passe de 63,01 % à 68,55 %. Sur ITSM, avec DeepSeek-V4.1-Flash comme enseignant, 1 994 échantillons générés en 66 heures font passer le Pass@1 moyen de 18,77 % à 27,18 %.
Motif de la recommandation :L'article détaille un pipeline de génération de données d'entraînement pour agents d'entreprise, avec les critères de qualité et les résultats chiffrés sur deux domaines.
AWS Professional Services a conçu un modèle à quatre agents (Intake, IaC, Migration Intelligence and Governance.
NVIDIA NeMo Agent Toolkit (NAT), framework open source d'orchestration d'agents compatible avec Strands Agents.
Amazon Bedrock AgentCore permet de construire des agents ambiants qui réagissent à des flux d'événements (dépôts S3.
Google DeepMind annonce Gemini 4 Argon, un modèle frontière conçu pour maintenir un raisonnement profond sur des workflows complexes et longs.
Motif de la recommandation :L'annonce détaille les capacités d'Argon en codage, travail de connaissance et cybersécurité, ainsi que son prix et son déploiement progressif.
CoreWeave annonce la disponibilité des systèmes NVIDIA Vera Rubin NVL72 avec réseau Spectrum-X 102.4T Ethernet.
Motif de la recommandation :L'annonce détaille la disponibilité en production de Vera Rubin NVL72 et de la CPU Vera, avec des chiffres de débit et de démarrage de sandbox qui aident à évaluer les charges agentiques.
Arduino positionne ses cartes VENTUNO Q et UNO Q comme environnements persistants pour agents IA.
Hugging Face publie ProvenanceGuard, une couche de vérification post-génération pour les agents MCP qui distingue la source réelle de chaque affirmation au lieu de fusionner les preuves. Testé sur 281 traces d'un agent médical, il a détecté 138 des 139 affirmations jugées non valides par des experts et identifié la bonne source dans environ 86 % des cas. La méthode conserve l'identité des sources à travers décomposition, routage, scoring et réparation de type RARR, sans réentraîner l'agent.
OpenAI lance GPT-6.1 Sol, présenté comme offrant une intelligence proche d'Astra pour le codage。
Motif de la recommandation :L'annonce donne le positionnement du modèle et un écart de prix par rapport à Astra, utile pour évaluer le coût d'un changement de modèle.
OpenAI a publié un récapitulatif de DevDay 2026, qui regroupe plus de 20 annonces couvrant GPT-6 Astra, ChatGPT, Codex, les API, la sécurité et de nouveaux outils pour les développeurs.
OpenAI présente dots, des assistants proactifs qui peuvent continuer à travailler sur des projets complexes et des tâches quotidiennes. Selon OpenAI。
H Company publie la série Holo4, des modèles agentiques en deux tailles : 27B dense et 35B-A3B Mixture of Experts.
Motif de la recommandation :Holo4 couvre GUI, code, MCP et API avec un même modèle, et les trajectoires des benchmarks sont ouvertes, ce qui permet de comparer le coût et les performances des agents computer-use.
GitHub Copilot app permet de créer des canvases, des interfaces personnalisées partagées avec l'agent.
GitHub Copilot mise sur les canvases, de petites applications full-stack exécutées dans l'application Copilot.
Google Research présente un AI video co-director, un cadre multi-agents construit comme couche d'orchestration au-dessus de Gemini et Veo.
Motif de la recommandation :L'article détaille quatre cadres multi-agents pour la génération vidéo longue, avec les problèmes de dérive visuelle et de propagation d'erreurs qu'ils traitent.
GitHub Security Lab publie le Fuzzing Taskflow, un pipeline de fuzzing autonome pour les projets C/C++ construit sur son framework Taskflow Agent. Il suffit d'indiquer un dépôt GitHub pour que l'agent identifie les points d'entrée, analyse le système de build, écrit les harnesses, lance AFL++, lit les rapports de couverture, améliore les harnesses, trie les crashs et rédige un rapport de vulnérabilité par bug unique. Le pipeline sépare les décisions de l'agent des outils MCP qui exécutent réellement les opérations, stocke l'état dans une base SQLite et utilise Claude Sonnet 5 par défaut. L'auteur prévient que le taskflow exécute afl-fuzz, clang et des commandes de build choisies par le LLM directement sur l'hôte, et recommande de ne le lancer que dans un environnement jetable sans privilèges élevés.
Motif de la recommandation :Le pipeline détaille la répartition des tâches entre l'agent et les outils MCP, ainsi que la boucle de rétroaction sur la couverture, une méthode directement transposable à d'autres automatisations de sécurité.
GitHub Copilot app a reconstruit sa vue de pull request pour rester fluide sur des diffs extrêmes.
Ringg résout jusqu'à 65 % des appels clients avec des agents IA propulsés par GPT-5.6, déployés sur la voix, le chat, WhatsApp et le web. Le coût est réduit de 90 % par rapport à GPT-4.1.
V7 réduit les coûts de 78 % tout en améliorant la précision grâce à GPT-5.6 Luna. En utilisant GPT-5.6。
Dans un épisode du GitHub Podcast, GitHub démonte cinq idées reçues sur l'IA : il reste nécessaire de lire le code généré.
GitHub a réécrit le runtime de l'agent Copilot, initialement en TypeScript sur Node.js.
Motif de la recommandation :Le récit détaillé d'une migration de runtime de 430 000 lignes de TypeScript vers Rust menée par des agents, avec les chiffres de cache, de compaction et de répartition des rôles.
OpenAI dévoile de nouvelles expériences publicitaires propulsées par l'IA, dont des Sponsored Agents。
GPT‑6 Astra permet aux agents de données de Hex de convertir des réponses analytiques en visualisations interactives que les employés partagent. L'outil vise à transformer des analyses complexes en rapports visuels directement exploitables.
GitHub Copilot permet d'automatiser l'ensemble du cycle de vie d'un événement marketing.
Cognition utilise GPT‑6 Astra pour permettre à Devin de tester lui-même le logiciel qu'il produit et de démontrer son bon fonctionnement. L'objectif affiché est de réduire le temps que les ingénieurs consacrent à la revue de code et d'augmenter la part de code effectivement livrée.
Google Research présente ToolGrad, une méthode « réponse d'abord » qui génère d'abord une chaîne d'utilisation d'outils de référence.
Mistral AI a migré 40 000 lignes de Fortran 77 vers C++ pour un opérateur énergétique européen.
Motif de la recommandation :L'article détaille un workflow d'agents structuré avec harnais de parité et documentation préalable, directement transposable à d'autres migrations de code legacy.
Une recherche d'OpenAI montre comment les entreprises adoptent l'IA agentique via ChatGPT et Codex。
OpenAI ajoute de nouveaux plugins éducatifs à ChatGPT Work et Codex destinés aux enseignants du primaire et du secondaire。
OpenAI présente GPT-5.6, qui améliore l'efficacité de l'IA au niveau des modèles, de l'inférence et des workflows d'agents, afin d'offrir davantage d'intelligence utile par dollar dépensé.
Motif de la recommandation :L'original indique que GPT-5.6 améliore l'efficacité au niveau du modèle, de l'inférence et des workflows d'agents, ce qui permet de juger de l'évolution du rapport coût-performance.
Un nouveau field report d'OpenAI montre comment les scientifiques utilisent des agents de codage IA pour moderniser le calcul scientifique。
Berkeley AI Research présente ABBEL, un framework qui isole et supervise le contenu des résumés sous forme d'états de croyance en langage naturel.
OpenAI lance OpenAI Presence, une plateforme d'agents IA d'entreprise éprouvée qui permet aux organisations de déployer des agents vocaux et de chat fiables pour les workflows clients et internes.
ChatGPT Work prend en charge des workflows de data science, notamment les briefs de root cause。
OpenAI présente ChatGPT Work, un agent capable d'agir dans vos applications et fichiers, de rester sur un projet pendant des heures si nécessaire et de transformer un objectif en travail achevé.
Motif de la recommandation :Présentation de ChatGPT Work comme agent capable d'agir sur les applications et fichiers et de mener un projet sur plusieurs heures.
Aditya G. Parameswaran (UC Berkeley) et ses collaborateurs identifient trois défis pour les data systems à l'ère de l'inférence quasi gratuite.
OpenAI, Thrive 与 Crete 联合打造了一款基于 Codex 的可自我改进税务代理, 用于自动化税务申报, 提升准确性并加速工作流程. 该代理借助 Codex 实现申报流程自动化, 并具备持续自我改进能力.
Warp s'appuie sur GPT-5.5 et les modèles OpenAI pour coordonner des agents de codage à travers des workflows de développement locaux, cloud et open source.