Aller au contenu
  1. Hugging Face Blog62

    ServiceNow présente AutoSynthData, un pipeline de génération de données d'entraînement pour agents d'entreprise

    ServiceNow CoreAI présente AutoSynthData, un pipeline qui transforme les échecs d'un modèle cible et les succès d'un enseignant plus fort en nouvelles tâches d'entraînement validées dans l'environnement. Le système génère des tâches composées d'une spécification système, d'un prompt utilisateur et d'un vérificateur, avec des contrôles de faisabilité, de réalisme et de difficulté, puis une vérification positive et négative et une phase de réparation. Sur EnterpriseOps Gym Hybrid, avec Gemma-4-26B-A4B-it comme cible et Qwen3.8-27B comme enseignant, 2 000 échantillons générés en environ 18 heures améliorent le Pass@1 moyen de 7,2 points, soit une hausse relative de 35 %, et le taux de succès du vérificateur passe de 63,01 % à 68,55 %. Sur ITSM, avec DeepSeek-V4.1-Flash comme enseignant, 1 994 échantillons générés en 66 heures font passer le Pass@1 moyen de 18,77 % à 27,18 %.

    Motif de la recommandation :L'article détaille un pipeline de génération de données d'entraînement pour agents d'entreprise, avec les critères de qualité et les résultats chiffrés sur deux domaines.

  1. OpenAI News75

    OpenAI publie la fiche système de ChatGPT agent

    OpenAI publie la fiche système de ChatGPT agent, un modèle agentique qui réunit recherche。

    Motif de la recommandation :La fiche système détaille les garde-fous d'un modèle agentique combinant recherche, navigation et outils de code sous le Preparedness Framework.

  1. OpenAI News78

    OpenAI apprend à Minecraft via Video PreTraining

    OpenAI a entraîné un réseau de neurones à jouer à Minecraft par Video PreTraining (VPT) sur un vaste ensemble de vidéos non étiquetées de parties humaines。

    Motif de la recommandation :Présente une méthode d'entraînement par pré-entraînement vidéo et une tâche de fabrication d'outils en diamant, utile pour comprendre les capacités des agents sur ordinateur.

  1. OpenAI News62

    OpenAI 在多智能体交互中观察到工具使用的涌现

    OpenAI 在模拟捉迷藏环境中训练智能体, 观察到它们在游戏过程中逐步学会使用更复杂的工具, 并形成六种不同的策略与反策略, 其中一些策略是该环境原本未预设支持的. 研究指出, 这种在简单环境中自监督涌现出的复杂性, 进一步表明多智能体共同适应未来可能产生极其复杂且智能的行为.

    Motif de la recommandation :通过捉迷藏环境观察智能体自发形成六种策略与反策略, 为多智能体协同演化提供可复现的实验线索.

Fin de la liste