Aller au contenu
10mois2jourvendredi
  1. Hugging Face Blog62

    ServiceNow présente AutoSynthData, un pipeline de génération de données d'entraînement pour agents d'entreprise

    ServiceNow CoreAI présente AutoSynthData, un pipeline qui transforme les échecs d'un modèle cible et les succès d'un enseignant plus fort en nouvelles tâches d'entraînement validées dans l'environnement. Le système génère des tâches composées d'une spécification système, d'un prompt utilisateur et d'un vérificateur, avec des contrôles de faisabilité, de réalisme et de difficulté, puis une vérification positive et négative et une phase de réparation. Sur EnterpriseOps Gym Hybrid, avec Gemma-4-26B-A4B-it comme cible et Qwen3.8-27B comme enseignant, 2 000 échantillons générés en environ 18 heures améliorent le Pass@1 moyen de 7,2 points, soit une hausse relative de 35 %, et le taux de succès du vérificateur passe de 63,01 % à 68,55 %. Sur ITSM, avec DeepSeek-V4.1-Flash comme enseignant, 1 994 échantillons générés en 66 heures font passer le Pass@1 moyen de 18,77 % à 27,18 %.

    Motif de la recommandation :L'article détaille un pipeline de génération de données d'entraînement pour agents d'entreprise, avec les critères de qualité et les résultats chiffrés sur deux domaines.

10mois1jourjeudi
9mois30jourmercredi
  1. NVIDIA Blog62

    NVIDIA et CoreWeave mettent en production Vera Rubin NVL72 et la CPU Vera pour l'IA agentique

    CoreWeave annonce la disponibilité des systèmes NVIDIA Vera Rubin NVL72 avec réseau Spectrum-X 102.4T Ethernet.

    Motif de la recommandation :L'annonce détaille la disponibilité en production de Vera Rubin NVL72 et de la CPU Vera, avec des chiffres de débit et de démarrage de sandbox qui aident à évaluer les charges agentiques.

9mois29jourmardi
  1. Hugging Face Blog30

    ProvenanceGuard : vérification de factualité sensible aux sources pour les agents MCP

    Hugging Face publie ProvenanceGuard, une couche de vérification post-génération pour les agents MCP qui distingue la source réelle de chaque affirmation au lieu de fusionner les preuves. Testé sur 281 traces d'un agent médical, il a détecté 138 des 139 affirmations jugées non valides par des experts et identifié la bonne source dans environ 86 % des cas. La méthode conserve l'identité des sources à travers décomposition, routage, scoring et réparation de type RARR, sans réentraîner l'agent.

  2. OpenAI News85

    OpenAI lance GPT-6.1 Sol

    OpenAI lance GPT-6.1 Sol, présenté comme offrant une intelligence proche d'Astra pour le codage。

    Motif de la recommandation :L'annonce donne le positionnement du modèle et un écart de prix par rapport à Astra, utile pour évaluer le coût d'un changement de modèle.

9mois28jourlundi
  1. Hugging Face Blog78

    H Company publie Holo4, une série de modèles agentiques pour l'usage informatique généraliste

    H Company publie la série Holo4, des modèles agentiques en deux tailles : 27B dense et 35B-A3B Mixture of Experts.

    Motif de la recommandation :Holo4 couvre GUI, code, MCP et API avec un même modèle, et les trajectoires des benchmarks sont ouvertes, ce qui permet de comparer le coût et les performances des agents computer-use.

9mois26joursamedi
9mois25jourvendredi
  1. Google Research70

    Google Research présente un cadre multi-agents pour automatiser la génération vidéo longue cohérente

    Google Research présente un AI video co-director, un cadre multi-agents construit comme couche d'orchestration au-dessus de Gemini et Veo.

    Motif de la recommandation :L'article détaille quatre cadres multi-agents pour la génération vidéo longue, avec les problèmes de dérive visuelle et de propagation d'erreurs qu'ils traitent.

  2. GitHub Blog · AI & ML62

    GitHub Security Lab Taskflow Agent : un pipeline de fuzzing autonome pour les projets C/C++

    GitHub Security Lab publie le Fuzzing Taskflow, un pipeline de fuzzing autonome pour les projets C/C++ construit sur son framework Taskflow Agent. Il suffit d'indiquer un dépôt GitHub pour que l'agent identifie les points d'entrée, analyse le système de build, écrit les harnesses, lance AFL++, lit les rapports de couverture, améliore les harnesses, trie les crashs et rédige un rapport de vulnérabilité par bug unique. Le pipeline sépare les décisions de l'agent des outils MCP qui exécutent réellement les opérations, stocke l'état dans une base SQLite et utilise Claude Sonnet 5 par défaut. L'auteur prévient que le taskflow exécute afl-fuzz, clang et des commandes de build choisies par le LLM directement sur l'hôte, et recommande de ne le lancer que dans un environnement jetable sans privilèges élevés.

    Motif de la recommandation :Le pipeline détaille la répartition des tâches entre l'agent et les outils MCP, ainsi que la boucle de rétroaction sur la couverture, une méthode directement transposable à d'autres automatisations de sécurité.

9mois24jourjeudi
9mois23jourmercredi
9mois21jourlundi
9mois18jourvendredi
9mois17jourjeudi
9mois16jourmercredi
9mois12joursamedi
9mois11jourvendredi
9mois9jourmercredi
8mois12jourmercredi
8mois4jourmardi
7mois29jourmercredi
  1. OpenAI News78

    GPT-5.6 : comment concilier intelligence de pointe et efficacité

    OpenAI présente GPT-5.6, qui améliore l'efficacité de l'IA au niveau des modèles, de l'inférence et des workflows d'agents, afin d'offrir davantage d'intelligence utile par dollar dépensé.

    Motif de la recommandation :L'original indique que GPT-5.6 améliore l'efficacité au niveau du modèle, de l'inférence et des workflows d'agents, ce qui permet de juger de l'évolution du rapport coût-performance.

7mois26jourdimanche
7mois22jourmercredi
7mois14jourmardi
7mois9jourjeudi
  1. OpenAI News67

    OpenAI présente ChatGPT Work, un agent pour les projets ambitieux

    OpenAI présente ChatGPT Work, un agent capable d'agir dans vos applications et fichiers, de rester sur un projet pendant des heures si nécessaire et de transformer un objectif en travail achevé.

    Motif de la recommandation :Présentation de ChatGPT Work comme agent capable d'agir sur les applications et fichiers et de mener un projet sur plusieurs heures.

7mois7jourmardi
5mois27jourmercredi