Le champ technique qui permet aux modèles de planifier de façon autonome, d'appeler des outils et d'accomplir des tâches en plusieurs étapes — toute l'actualité, de Claude Code et Manus aux frameworks d'agents et aux benchmarks d'évaluation de chaque acteur.
130 sélections30 derniers jours 16 entréesTotal : 273 entrées
mise à jour
Archives de la sélection · page 3
6mois4jourjeudi41–60 entrées · Au total 130 entrées
Motif de la recommandation :L'article détaille la refonte du CLI hf pour les agents et publie un benchmark comparant consommation de tokens et taux de réussite face à curl et au SDK Python.
Motif de la recommandation :La famille Holo3.1 expose les gains sur AndroidWorld et les checkpoints quantifiés pour l'inférence locale, ce qui aide à évaluer le déploiement d'agents computer-use.
Motif de la recommandation :JetBrains publie un MoE 12B à 2,5B paramètres actifs sous Apache 2.0, avec des cas d'usage précis pour le routage, le RAG et les sous-agents.
Motif de la recommandation :Mistral détaille sa pile IA industrielle et son agent Vibe, avec des partenariats Airbus, BMW et ASML et un centre de données en France, ce qui éclaire le positionnement entreprise.
Motif de la recommandation :Mistral regroupe travail et codage dans un seul agent et détaille les modes, les intégrations et les tarifs, ce qui aide à évaluer son adoption en entreprise.
Mistral AI publie en aperçu public Search Toolkit, un cadre composable et open source pour construire des pipelines de recherche destinés aux applications IA。
Motif de la recommandation :Un cadre unifié d'ingestion, de récupération et d'évaluation, open source et déployable sur site, qui permet de comparer les configurations de recherche sur ses propres données.
Motif de la recommandation :Mistral Medium 3.5 est publié en open weights et devient le modèle par défaut de Vibe et Le Chat, avec des agents cloud asynchrones et un mode Work.
Motif de la recommandation :Mistral AI expose les connecteurs MCP intégrés et personnalisés dans Studio, avec appels d'outils directs et validation humaine, ce qui permet de juger comment structurer les intégrations d'agents d'entreprise.
Motif de la recommandation :L'article détaille les applications concrètes d'AlphaEvolve dans la génomique, les réseaux électriques, les TPU et la logistique, avec des chiffres vérifiables.
OpenAI annonce que ses modèles GPT, Codex et Managed Agents sont désormais disponibles sur AWS. Les entreprises peuvent ainsi développer des solutions d'IA sécurisées directement dans leur environnement AWS.
Motif de la recommandation :Les modèles OpenAI, Codex et Managed Agents sont désormais disponibles sur AWS, ce qui permet aux entreprises de déployer l'IA dans leur environnement cloud existant.
Motif de la recommandation :Présentation de la couche d'orchestration Workflows et de son SDK Python, avec des cas d'usage concrets et un modèle de déploiement hybride.
Motif de la recommandation :L'article détaille l'architecture CSA/HCA et les choix de post-entraînement qui rendent l'inférence à 1M tokens exploitable pour les agents.
Motif de la recommandation :Présente les agents d'espace de travail de ChatGPT et leur exécution cloud sécurisée, utile pour évaluer l'automatisation des flux d'équipe.
Google Research présente ReasoningBank, un cadre de mémoire d'agent publié à l'ICLR qui distille des schémas de raisonnement de haut niveau à partir d'expériences réussies et échouées pour l'auto-évolution au moment du test. Chaque mémoire structurée contient un titre, une description et un contenu de raisonnement distillé, et le flux fonctionne en boucle fermée de récupération, extraction et consolidation. Sur WebArena et SWE-Bench-Verified avec Gemini-2.5-Flash, ReasoningBank dépasse les agents sans mémoire de 8,3 % et 4,6 % de taux de réussite, et le couplage avec le memory-aware test-time scaling (MaTTS) apporte 3 % de réussite supplémentaire et 0,4 étape en moins sur WebArena.
Motif de la recommandation :L'article détaille le mécanisme de mémoire ReasoningBank et les gains mesurés sur WebArena et SWE-Bench-Verified, utile pour comprendre l'auto-évolution des agents.
Motif de la recommandation :L'original énumère les nouvelles capacités de Codex sur macOS et Windows, ce qui permet de juger comment elles s'intègrent aux flux de travail des développeurs.
Motif de la recommandation :Le Skill et le harnais de test transforment le portage de modèles transformers vers mlx-lm en un processus reproductible, avec des règles concrètes pour des PR de qualité.
OpenAI met à jour le SDK Agents en y intégrant l'exécution sandbox native et un harness natif du modèle. Ces changements visent à aider les développeurs à construire des agents sécurisés et de longue durée capables d'opérer sur des fichiers et des outils.
Motif de la recommandation :L'original expose les deux changements clés du SDK Agents, exécution sandbox native et harness natif du modèle, ce qui permet de juger comment les agents longs et sécurisés modifient les flux de développement existants.
HCompany lance HoloTab, une extension Chrome gratuite qui automatise des tâches sur n'importe quel site web sans configuration ni compétence technique。
Motif de la recommandation :HoloTab transforme le modèle computer-use Holo3 en extension Chrome gratuite, avec des routines enregistrées et rejouables, ce qui montre comment un agent navigue et agit dans le navigateur.