Le champ technique qui permet aux modèles de planifier de façon autonome, d'appeler des outils et d'accomplir des tâches en plusieurs étapes — toute l'actualité, de Claude Code et Manus aux frameworks d'agents et aux benchmarks d'évaluation de chaque acteur.
130 sélections30 derniers jours 16 entréesTotal : 273 entrées
mise à jour
Archives de la sélection · page 2
8mois14jourvendredi21–40 entrées · Au total 130 entrées
Motif de la recommandation :Le tarif de lancement et les écarts chiffrés sur plusieurs benchmarks permettent de situer le gain par rapport à 3.6 Flash pour les charges de codage et d'agents.
Motif de la recommandation :Meta publie un modèle multimodal de 30B sous Apache 2.0 avec support day-0 dans transformers, llama.cpp et vLLM, ce qui permet d'évaluer son usage local pour le codage et l'analyse de documents.
Motif de la recommandation :Le cadre open source et les recettes d'entraînement par domaine montrent comment de petits modèles ouverts atteignent des scores élevés sur SWE-bench Verified et des benchmarks web.
OpenAI présente GPT-5.6, qui améliore l'efficacité de l'IA au niveau des modèles, de l'inférence et des workflows d'agents, afin d'offrir davantage d'intelligence utile par dollar dépensé.
Motif de la recommandation :L'original indique que GPT-5.6 améliore l'efficacité au niveau du modèle, de l'inférence et des workflows d'agents, ce qui permet de juger de l'évolution du rapport coût-performance.
Motif de la recommandation :L'étude compare à grande échelle les diagnostics différentiels d'agents conversationnels à ceux de cliniciens et les recoupe avec des données de wearables.
Motif de la recommandation :Google DeepMind détaille les gains de tokens, les prix et les benchmarks des nouveaux Gemini Flash, utiles pour évaluer le coût des workflows agentiques.
OpenAI présente ChatGPT Work, un agent capable d'agir dans vos applications et fichiers, de rester sur un projet pendant des heures si nécessaire et de transformer un objectif en travail achevé.
Motif de la recommandation :Présentation de ChatGPT Work comme agent capable d'agir sur les applications et fichiers et de mener un projet sur plusieurs heures.
Motif de la recommandation :L'intégration native de la capacité computer use dans Gemini 3.5 Flash et les garde-fous d'entreprise associés permettent de juger comment construire des agents multiplateformes.
L'équipe Hugging Face présente localpager, un système de triage des issues et PR du dépôt OpenClaw utilisant des modèles locaux gemma-4-26b-a4b et qwen3.6-35b-a3b dans un harnais d'agent avec sortie structurée et un shell restreint en lecture seule. Sur un jeu d'évaluation de 330 lignes, Qwen obtient une précision de 0,831 et un exact match de 0,540, tandis que Gemma atteint un rappel de 0,905 avec 1,41 seconde par ligne à concurrence 16. Le système est semi-agentique : le classement est confié au modèle local, tandis que l'envoi des notifications Discord suit des règles déterministes, et une passe GPT-5.5 toutes les 2 heures sert de juge pour mesurer les faux positifs et faux négatifs.
Motif de la recommandation :L'article détaille une architecture de triage semi-agentique avec modèles locaux, incluant les métriques comparatives et les compromis de déploiement.
Motif de la recommandation :L'article présente un harnais d'évaluation qui mesure le coût d'exécution des agents sur une bibliothèque, avec des résultats contre-intuitifs sur l'effet du CLI et du Skill selon la taille du modèle.
AWS publie Strands Robots, un SDK open source (Apache 2.0) qui expose la pile LeRobot sous forme d'AgentTools composables dans un agent Strands unique. Le billet détaille cinq étapes 。
Motif de la recommandation :Présente un flux complet de l'entraînement au déploiement matériel via un agent unique, avec des exemples de code exécutables et des considérations de sécurité.
Z.ai présente GLM-5.2, son nouveau modèle phare pour les tâches longue durée, qui succède à GLM-5.1 et prend en charge un contexte solide de 1M tokens. Il introduit IndexShare。
Motif de la recommandation :Le modèle phare GLM-5.2 est publié avec un contexte de 1M tokens et des benchmarks de codage longue durée, ce qui permet de comparer les performances des modèles ouverts et fermés.
Motif de la recommandation :L'original détaille la spécification ARD et son implémentation de référence sur le Hub, ce qui permet de comprendre comment la découverte de capacités se sépare de l'exécution.
Google DeepMind présente son AI Control Roadmap, un cadre de défense en profondeur qui traite les agents internes comme potentiellement mal alignés et ajoute une couche de sécurité système au-delà de l'alignement des modèles. Le dispositif s'appuie sur un cadre de modélisation des menaces inspiré de MITRE ATT&CK, des superviseurs IA surveillant le raisonnement et les actions des agents, et des niveaux de détection D1-D4 et de prévention/réponse R1-R3 indexés sur les capacités du modèle. L'équipe indique avoir analysé un million de tâches d'agents de codage et utilisé ces données pour un moniteur en direct du agent Gemini Spark, la majorité des événements signalés provenant de mauvaises interprétations plutôt que d'une intention adverse. DeepMind publie en parallèle un cadre technique pour les décideurs, 'Three Layers of Agent Security'.
Motif de la recommandation :Google DeepMind détaille son AI Control Roadmap et les niveaux D1-D4/R1-R3, une grille de sécurité des agents directement transposable à d'autres déploiements.
OpenAI prévoit d'acquérir Ona afin d'étendre Codex avec des environnements cloud sécurisés et persistants, permettant des agents IA de longue durée sur les workflows d'entreprise.
Motif de la recommandation :L'acquisition d'Ona par OpenAI éclaire l'évolution de Codex vers des agents cloud persistants pour les workflows d'entreprise.
Motif de la recommandation :L'auteur montre comment un agent enchaîne deux Spaces Hugging Face via agents.md pour produire des splats 3D à partir de simples prompts, une méthode directement réutilisable.
Motif de la recommandation :OpenEnv passe sous gouvernance communautaire et se recentre sur une couche d'interopérabilité pour les environnements RL agentiques, ce qui éclaire les choix d'outillage des équipes qui entraînent des agents.
Motif de la recommandation :L'article détaille l'architecture multi-agents et le mécanisme de contexte suffisant, avec des gains de précision mesurés sur FramesQA.