OpenAI参与发布AI开发可验证性报告, 提出10项机制
OpenAI与30个组织的58位合著者共同发布了一份多利益相关方报告, 提出10项提升AI系统声明可验证性的机制. 这些机制可供开发者提供AI系统安全, 可靠, 公平或隐私保护方面的证据, 也可供用户, 政策制定者和公民社会评估AI开发流程.
OpenAI与30个组织的58位合著者共同发布了一份多利益相关方报告, 提出10项提升AI系统声明可验证性的机制. 这些机制可供开发者提供AI系统安全, 可靠, 公平或隐私保护方面的证据, 也可供用户, 政策制定者和公民社会评估AI开发流程.
OpenAI présente OpenAI Microscope, une collection de visualisations de chaque couche et neurone significatifs de huit « organismes modèles » de vision souvent étudiés en interprétabilité. L'outil vise à faciliter l'analyse des caractéristiques qui se forment à l'intérieur de ces réseaux neuronaux et à aider la communauté de recherche à mieux comprendre ces systèmes complexes.
OpenAI 发布关于 Dota 2 与大规模深度强化学习的研究内容.
OpenAI montre que le phénomène de double descent apparaît dans les CNNs, les ResNets et les transformers 。
OpenAI 发布 Procgen Benchmark, 包含 16 个易于使用, 程序化生成的环境, 用于直接衡量强化学习智能体学习可泛化技能的速度.
OpenAI publie Safety Gym, une suite d'environnements et d'outils destinée à mesurer les progrès vers des agents d'apprentissage par renforcement qui respectent des contraintes de sécurité pendant l'entraînement.
OpenAI 训练了一对神经网络, 让类人机械手解开魔方. 神经网络完全在模拟环境中训练, 使用与 OpenAI Five 相同的强化学习代码, 并搭配名为 Automatic Domain Randomization (ADR) 的新技术. 该系统能处理训练中从未见过的情况。
Motif de la recommandation :展示了纯模拟训练的策略如何迁移到真实机械手, 并应对训练中未见的干扰, 对具身智能研究有参考价值.
OpenAI ouvre les candidatures pour la troisième promotion de son programme OpenAI Scholars。
OpenAI a ajusté le modèle de langage GPT-2 de 774M paramètres à l'aide de retours humains pour diverses tâches。
Motif de la recommandation :L'original expose les préférences humaines et le nombre d'annotations nécessaires pour différentes tâches, ce qui permet de comprendre le coût et les limites du fine-tuning par retour humain.
OpenAI 在模拟捉迷藏环境中训练智能体, 观察到它们在游戏过程中逐步学会使用更复杂的工具, 并形成六种不同的策略与反策略, 其中一些策略是该环境原本未预设支持的. 研究指出, 这种在简单环境中自监督涌现出的复杂性, 进一步表明多智能体共同适应未来可能产生极其复杂且智能的行为.
Motif de la recommandation :通过捉迷藏环境观察智能体自发形成六种策略与反策略, 为多智能体协同演化提供可复现的实验线索.
OpenAI提出一种评估神经网络分类器能否可靠抵御训练中未见对抗攻击的方法, 并由此得出新指标UAR (Unforeseen Attack Robustness), 用于衡量单一模型面对未预期攻击时的鲁棒性. 该方法强调需要在更多样化的未知攻击范围内衡量模型表现.
OpenAI a publié un document de recherche politique identifiant quatre stratégies pour améliorer la coopération industrielle à long terme sur les normes de sécurité en IA 。
La deuxième promotion d'OpenAI Scholars a achevé son programme, les huit boursiers ayant présenté leur projet final lors du Scholars Demo Day organisé chez OpenAI.
OpenAI 开发了 Sparse Transformer, 这是一种深度神经网络, 在预测序列中下一个内容的任务上创下新纪录, 适用于文本, 图像和声音. 它通过对注意力机制进行算法改进, 从比以往可能处理的序列长 30 倍的序列中提取模式.
OpenAI Five est la première IA à battre les champions du monde d'un jeu esport, en remportant deux parties consécutives face à l'équipe championne du monde de Dota 2。
OpenAI 在基于能量的模型 (EBM)的稳定, 可扩展训练上取得进展, 其样本质量和泛化能力优于现有模型. EBM 的生成过程会消耗更多算力持续精炼答案, 在低温下可生成与 GAN 媲美的样本, 同时具备基于似然模型的模式覆盖保证. OpenAI 希望这些发现能推动对这一类模型的研究.
OpenAI 与 Google 研究人员合作推出 Activation Atlases, 一种可视化神经元之间交互所代表内容的新技术. 随着 AI 系统被部署到日益敏感的场景中, 更好地理解其内部决策过程有助于识别弱点和调查故障.
OpenAI publie Neural MMO, un environnement de jeu massivement multi-agents destiné aux agents d'apprentissage par renforcement. La plateforme prend en charge un nombre important et variable d'agents dans une tâche persistante et ouverte. La présence de nombreux agents et espèces favorise une meilleure exploration, la formation de niches divergentes et une compétence globale accrue.
OpenAI a organisé le 2 février son premier Spinning Up Workshop, dans le cadre de sa nouvelle initiative éducative. Ce workshop s'inscrit dans le programme Spinning Up consacré au deep RL.
OpenAI publie un article affirmant que la recherche sur la sécurité à long terme de l'IA nécessite la collaboration de spécialistes des sciences sociales pour garantir le succès des algorithmes d'alignement lorsque de véritables humains sont impliqués. L'alignement des systèmes d'IA avancés sur les valeurs humaines exige de lever de nombreuses incertitudes liées à la psychologie de la rationalité, des émotions et des biais humains. OpenAI prévoit de recruter des spécialistes des sciences sociales pour travailler à plein temps sur ce sujet et entend stimuler la collaboration entre chercheurs en machine learning et en sciences sociales.
OpenAI 训练了一个大规模无监督语言模型, 能够生成连贯的段落文本, 在多项语言建模基准上取得最优表现, 并在无需特定任务训练的情况下完成初步的阅读理解, 机器翻译, 问答和摘要.
OpenAI a découvert que le gradient noise scale, une métrique statistique simple。
OpenAI publie CoinRun, un environnement d'entraînement qui fournit une métrique pour la capacité d'un agent à transférer son expérience vers des situations nouvelles. CoinRun a déjà aidé à clarifier un puzzle de longue date en apprentissage par renforcement. L'environnement se situe à un niveau de complexité intermédiaire : plus simple que les jeux de plateforme traditionnels comme Sonic the Hedgehog, mais il reste un défi de généralisation sérieux pour les algorithmes de pointe.
OpenAI 发布 Spinning Up in Deep RL, 一套面向深度强化学习 (RL)的教育资源, 旨在让任何人都能学习成为熟练的深度强化学习实践者. 该资源包含清晰易懂的 RL 代码示例, 教学练习, 文档和教程.
OpenAI a mis au point un modèle à base d'énergie capable d'apprendre à identifier et générer des instances de concepts — tels que near。
OpenAI 开发了 Random Network Distillation (RND), 一种基于预测的奖励方法, 通过好奇心鼓励强化学习智能体探索环境, 在 Montezuma's Revenge 上首次超过人类平均表现.
OpenAI propose une technique de sûreté IA appelée iterated amplification。
OpenAI Five a perdu deux parties contre des joueurs de Dota 2 de haut niveau à The International à Vancouver cette semaine。
Hier, OpenAI Five a remporté un best-of-three face à une équipe de joueurs de Dota classés au 99。
OpenAI indique avoir entraîné une main robotique humanoïde à manipuler des objets physiques avec une dextérité inédite.
Le match de benchmark OpenAI Five est terminé.
OpenAI présente Glow, un modèle génératif réversible qui utilise des convolutions 1x1 inversibles. Il étend les travaux antérieurs sur les modèles génératifs réversibles et simplifie l'architecture. Le modèle peut générer des images réalistes à haute résolution, prend en charge un échantillonnage efficace et découvre des caractéristiques permettant de manipuler les attributs des données. Le code du modèle et un outil de visualisation en ligne sont publiés.
OpenAI a entraîné un agent à atteindre un score élevé de 74 500 sur Montezuma's Revenge à partir d'une seule démonstration humaine。
Motif de la recommandation :L'article explique comment un agent atteint 74 500 points sur Montezuma's Revenge à partir d'une seule démonstration, avec un algorithme simple fondé sur PPO.
L'équipe de cinq réseaux neuronaux OpenAI Five a commencé à battre des équipes humaines amateurs sur Dota 2.
OpenAI a publié les résultats de la première édition du Retro Contest。
OpenAI a obtenu des résultats de pointe sur une série de tâches linguistiques variées avec un système évolutif et agnostique à la tâche。
OpenAI publie la version complète de Gym Retro, une plateforme de recherche en apprentissage par renforcement sur les jeux. Le nombre de jeux publics passe d'environ 70 jeux Atari et 30 jeux Sega à plus de 1000 jeux couvrant plusieurs émulateurs sous-jacents. OpenAI publie également l'outil utilisé pour ajouter de nouveaux jeux à la plateforme.
Motif de la recommandation :OpenAI ouvre une plateforme d'apprentissage par renforcement sur plus de 1000 jeux et publie l'outil d'ajout de jeux, ce qui permet de mesurer l'évolution de l'échelle des environnements disponibles.
OpenAI publie une analyse montrant que depuis 2012, la quantité de calcul utilisée dans les plus grands entraînements d'IA croît de façon exponentielle avec un temps de doublement de 3。
Motif de la recommandation :L'analyse quantifie la croissance exponentielle du calcul d'entraînement depuis 2012 et son rythme de doublement, un repère pour situer les capacités des futurs systèmes.
OpenAI propose une technique de sécurité de l'IA qui entraîne des agents à débattre entre eux sur un sujet, un humain jugeant qui gagne.
Motif de la recommandation :L'article expose une piste d'alignement où des agents débattent sous supervision humaine, utile pour situer les approches de sécurité de l'IA.
OpenAI publie Evolved Policy Gradients (EPG), une approche expérimentale de méta-apprentissage qui fait évoluer la fonction de perte des agents d'apprentissage afin de permettre un entraînement rapide sur de nouvelles tâches. Les agents entraînés avec EPG réussissent à l'évaluation des tâches de base hors de leur régime d'entraînement, comme apprendre à naviguer vers un objet situé du côté opposé de la pièce par rapport à sa position pendant l'entraînement.