Aller au contenu

Orientations techniques

Agent agent Dernières actualités

Le champ technique qui permet aux modèles de planifier de façon autonome, d'appeler des outils et d'accomplir des tâches en plusieurs étapes — toute l'actualité, de Claude Code et Manus aux frameworks d'agents et aux benchmarks d'évaluation de chaque acteur.

130 sélections30 derniers jours 16 entréesTotal : 273 entrées

mise à jour

Archives de la sélection · page 2

8mois14jourvendredi21–40 entrées
8mois10jourlundi
8mois4jourmardi
  1. Microsoft Research78

    Microsoft Research présente Orchard, un cadre open source pour l'IA agentique à grande échelle

    Microsoft Research présente Orchard, un cadre open source pour l'IA agentique à grande échelle。

    Motif de la recommandation :Le cadre open source et les recettes d'entraînement par domaine montrent comment de petits modèles ouverts atteignent des scores élevés sur SWE-bench Verified et des benchmarks web.

7mois29jourmercredi
  1. OpenAI News78

    GPT-5.6 : comment concilier intelligence de pointe et efficacité

    OpenAI présente GPT-5.6, qui améliore l'efficacité de l'IA au niveau des modèles, de l'inférence et des workflows d'agents, afin d'offrir davantage d'intelligence utile par dollar dépensé.

    Motif de la recommandation :L'original indique que GPT-5.6 améliore l'efficacité au niveau du modèle, de l'inférence et des workflows d'agents, ce qui permet de juger de l'évolution du rapport coût-performance.

7mois23jourjeudi
7mois21jourmardi
7mois17jourvendredi
7mois9jourjeudi
  1. OpenAI News67

    OpenAI présente ChatGPT Work, un agent pour les projets ambitieux

    OpenAI présente ChatGPT Work, un agent capable d'agir dans vos applications et fichiers, de rester sur un projet pendant des heures si nécessaire et de transformer un objectif en travail achevé.

    Motif de la recommandation :Présentation de ChatGPT Work comme agent capable d'agir sur les applications et fichiers et de mener un projet sur plusieurs heures.

6mois25jourjeudi
6mois22jourlundi
  1. Hugging Face Blog62

    Comment trier les PR et issues d'OpenClaw avec des modèles locaux Gemma et Qwen

    L'équipe Hugging Face présente localpager, un système de triage des issues et PR du dépôt OpenClaw utilisant des modèles locaux gemma-4-26b-a4b et qwen3.6-35b-a3b dans un harnais d'agent avec sortie structurée et un shell restreint en lecture seule. Sur un jeu d'évaluation de 330 lignes, Qwen obtient une précision de 0,831 et un exact match de 0,540, tandis que Gemma atteint un rappel de 0,905 avec 1,41 seconde par ligne à concurrence 16. Le système est semi-agentique : le classement est confié au modèle local, tandis que l'envoi des notifications Discord suit des règles déterministes, et une passe GPT-5.5 toutes les 2 heures sert de juge pour mesurer les faux positifs et faux négatifs.

    Motif de la recommandation :L'article détaille une architecture de triage semi-agentique avec modèles locaux, incluant les métriques comparatives et les compromis de déploiement.

6mois19jourvendredi
6mois18jourjeudi
  1. Hugging Face Blog62

    Hugging Face propose agent-eval pour évaluer l'usage agentique des bibliothèques open source

    Hugging Face publie agent-eval, un harnais d'évaluation qui mesure non seulement la réponse finale d'un agent mais aussi le nombre de tours。

    Motif de la recommandation :L'article présente un harnais d'évaluation qui mesure le coût d'exécution des agents sur une bibliothèque, avec des résultats contre-intuitifs sur l'effet du CLI et du Skill selon la taille du modèle.

6mois17jourmercredi
  1. Hugging Face Blog62

    AWS Strands Robots : du Hub Hugging Face au robot physique avec LeRobot

    AWS publie Strands Robots, un SDK open source (Apache 2.0) qui expose la pile LeRobot sous forme d'AgentTools composables dans un agent Strands unique. Le billet détaille cinq étapes 。

    Motif de la recommandation :Présente un flux complet de l'entraînement au déploiement matériel via un agent unique, avec des exemples de code exécutables et des considérations de sécurité.

  2. Hugging Face Blog88

    Z.ai publie GLM-5.2, modèle phare pour les tâches longue durée avec contexte de 1M tokens

    Z.ai présente GLM-5.2, son nouveau modèle phare pour les tâches longue durée, qui succède à GLM-5.1 et prend en charge un contexte solide de 1M tokens. Il introduit IndexShare。

    Motif de la recommandation :Le modèle phare GLM-5.2 est publié avec un contexte de 1M tokens et des benchmarks de codage longue durée, ce qui permet de comparer les performances des modèles ouverts et fermés.

  3. Hugging Face Blog62

    Hugging Face lance Discover Tool, implémentation de référence de la spécification Agentic Resource Discovery

    Hugging Face présente Agentic Resource Discovery (ARD), une spécification ouverte de découverte de capacités pour agents。

    Motif de la recommandation :L'original détaille la spécification ARD et son implémentation de référence sur le Hub, ce qui permet de comprendre comment la découverte de capacités se sépare de l'exécution.

6mois16jourmardi
  1. Google DeepMind62

    Google DeepMind publie l'AI Control Roadmap pour sécuriser les agents IA

    Google DeepMind présente son AI Control Roadmap, un cadre de défense en profondeur qui traite les agents internes comme potentiellement mal alignés et ajoute une couche de sécurité système au-delà de l'alignement des modèles. Le dispositif s'appuie sur un cadre de modélisation des menaces inspiré de MITRE ATT&CK, des superviseurs IA surveillant le raisonnement et les actions des agents, et des niveaux de détection D1-D4 et de prévention/réponse R1-R3 indexés sur les capacités du modèle. L'équipe indique avoir analysé un million de tâches d'agents de codage et utilisé ces données pour un moniteur en direct du agent Gemini Spark, la majorité des événements signalés provenant de mauvaises interprétations plutôt que d'une intention adverse. DeepMind publie en parallèle un cadre technique pour les décideurs, 'Three Layers of Agent Security'.

    Motif de la recommandation :Google DeepMind détaille son AI Control Roadmap et les niveaux D1-D4/R1-R3, une grille de sécurité des agents directement transposable à d'autres déploiements.

6mois11jourjeudi
  1. OpenAI News70

    OpenAI va acquérir Ona pour étendre Codex avec des environnements cloud sécurisés et persistants

    OpenAI prévoit d'acquérir Ona afin d'étendre Codex avec des environnements cloud sécurisés et persistants, permettant des agents IA de longue durée sur les workflows d'entreprise.

    Motif de la recommandation :L'acquisition d'Ona par OpenAI éclaire l'évolution de Codex vers des agents cloud persistants pour les workflows d'entreprise.

6mois9jourmardi
  1. Hugging Face Blog62

    Comment un agent a construit une galerie 3D de Paris en enchaînant deux Hugging Face Spaces

    Un agent de codage a construit une galerie 3D des monuments de Paris en appelant directement deux Hugging Face Spaces。

    Motif de la recommandation :L'auteur montre comment un agent enchaîne deux Spaces Hugging Face via agents.md pour produire des splats 3D à partir de simples prompts, une méthode directement réutilisable.

6mois8jourlundi
  1. Hugging Face Blog76

    Hugging Face place OpenEnv sous gouvernance communautaire pour le RL agentique open source

    OpenEnv, outil de création d'environnements d'exécution agentiques, est désormais coordonné par un comité incluant Meta-PyTorch。

    Motif de la recommandation :OpenEnv passe sous gouvernance communautaire et se recentre sur une couche d'interopérabilité pour les environnements RL agentiques, ce qui éclaire les choix d'outillage des équipes qui entraînent des agents.

6mois5jourvendredi