OpenAI发布块稀疏GPU内核
OpenAI发布针对块稀疏权重神经网络的高度优化GPU内核, 根据所选稀疏度, 这些内核的运行速度可比cuBLAS或cuSPARSE快数个数量级. OpenAI表示已用这些内核在文本情感分析以及文本和图像的生成建模中取得当前最优结果.
Motif de la recommandation :OpenAI公开了面向块稀疏权重网络的GPU内核, 并给出相对cuBLAS与cuSPARSE的数量级加速, 可供关注稀疏训练与推理工程化的读者参考.
OpenAI发布针对块稀疏权重神经网络的高度优化GPU内核, 根据所选稀疏度, 这些内核的运行速度可比cuBLAS或cuSPARSE快数个数量级. OpenAI表示已用这些内核在文本情感分析以及文本和图像的生成建模中取得当前最优结果.
Motif de la recommandation :OpenAI公开了面向块稀疏权重网络的GPU内核, 并给出相对cuBLAS与cuSPARSE的数量级加速, 可供关注稀疏训练与推理工程化的读者参考.
OpenAI a mis au point un algorithme d'apprentissage par renforcement hiérarchique qui apprend des actions de haut niveau utiles à la résolution de diverses tâches。
OpenAI a mis au point des techniques robotiques permettant à des contrôleurs entraînés entièrement en simulation。
Un agent de méta-apprentissage parvient à vaincre rapidement un agent adverse plus fort non méta-apprenant dans une tâche de lutte de robots simulés. Le même agent peut s'adapter à une défaillance physique.
OpenAI a découvert que l'auto-jeu permet à des IA simulées d'acquérir des compétences physiques comme le plaquage。
OpenAI publie LOLA (Learning with Opponent-Learning Awareness)。
OpenAI publie deux nouvelles implémentations dans OpenAI Baselines : ACKTR et A2C. A2C est une variante synchrone et déterministe d'A3C (Asynchronous Advantage Actor Critic)。
OpenAI 的 Dota 2 结果表明, 在算力充足时, 自我博弈可将机器学习系统从远低于人类水平提升至超人水平. 该系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手, 此后仍在持续提升. 与受限于训练数据集的监督式深度学习不同, 自我博弈系统的可用数据会随智能体变强而自动改进.
OpenAI a créé un bot qui bat les meilleurs joueurs professionnels du monde lors de matchs 1v1 de Dota 2 selon les règles standard des tournois. Le bot a appris le jeu à partir de zéro par auto-apprentissage, sans utiliser d'apprentissage par imitation ni de recherche arborescente. OpenAI présente cette avancée comme une étape vers la construction de systèmes d'IA capables d'accomplir des objectifs bien définis dans des situations complexes et désordonnées impliquant de vrais humains.
Motif de la recommandation :L'article explique comment un bot a appris Dota 2 par auto-apprentissage et a battu des joueurs professionnels, ce qui permet de comprendre les capacités et les limites de l'apprentissage autonome dans des environnements complexes.
OpenAI a publié RL-Teacher, une implémentation open source de son interface permettant d'entraîner des IA via des retours humains occasionnels plutôt que des fonctions de récompense écrites à la main. La technique sous-jacente a été développée comme une étape vers des systèmes d'IA sûrs, et s'applique aussi aux problèmes d'apprentissage par renforcement dont les récompenses sont difficiles à spécifier.
OpenAI a constaté que l'ajout d'un bruit adaptatif aux paramètres des algorithmes d'apprentissage par renforcement améliore fréquemment les performances. Cette méthode d'exploration est simple à implémenter et ne dégrade que très rarement les résultats, ce qui la rend intéressante à tester sur tout problème.
OpenAI 发布了一类新的强化学习算法 Proximal Policy Optimization (PPO), 其表现与当时最先进方法相当或更好, 同时实现和调参都简单得多. PPO 因易用且性能良好, 已成为 OpenAI 默认使用的强化学习算法.
Motif de la recommandation :OpenAI 公开了 PPO 这一强化学习算法的定位与内部采用情况, 可了解其相对已有方法的取舍.
OpenAI 创建了在不同尺度和视角下都能可靠欺骗神经网络分类器的图像, 直接挑战了上周提出的观点, 即自动驾驶汽车因从多尺度, 多角度, 多视角等采集图像而难以被恶意欺骗.
OpenAI publie en open source une bibliothèque Python haute performance dédiée à la simulation robotique。
OpenAI与DeepMind安全团队合作开发出一种算法, 通过让人类在两种候选行为中指出哪个更好, 来推断人类的目标, 从而避免手工编写目标函数. 该方法旨在消除人工编写目标函数的需求, 因为用简单代理替代复杂目标或目标设定稍有偏差, 都可能导致不良甚至危险的行为. 这是构建安全AI系统方向上的一步.
OpenAI explore les environnements multi-agents où des agents rivalisent pour des ressources。
OpenAI annonce l'open source d'OpenAI Baselines, son effort interne pour reproduire des algorithmes d'apprentissage par renforcement avec des performances comparables aux résultats publiés. Les algorithmes seront publiés au cours des prochains mois ; la version du jour inclut DQN et trois de ses variantes.
Motif de la recommandation :OpenAI ouvre le code de ses implémentations d'algorithmes d'apprentissage par renforcement, avec des performances alignées sur les résultats publiés.
OpenAI indique avoir créé un système robotique entraîné entièrement en simulation et déployé sur un robot physique, capable d'apprendre une nouvelle tâche après l'avoir vue réalisée une fois.
OpenAI publie Roboschool, un logiciel open source de simulation robotique intégré à OpenAI Gym.
OpenAI 开发了一个无监督系统, 仅通过预测 Amazon 评论中的下一个字符进行训练, 就学到了对情感的良好表示.
OpenAI a créé le premier AI de détection de spam au monde entraîné entièrement en simulation et déployé sur un robot physique.
OpenAI indique que les stratégies d'évolution (ES), une technique d'optimisation connue depuis des décennies。
OpenAI annonce soutenir le lancement de Distill, une nouvelle revue consacrée à l'excellente communication des résultats en machine learning, qu'ils soient nouveaux ou existants.
OpenAI 发布新研究, 介绍智能体在其中发展出自身语言. 该帖为摘要, 未提供更多细节.
Les exemples adversariaux sont des entrées conçues intentionnellement par un attaquant pour faire commettre une erreur au modèle d'apprentissage automatique。
OpenAI 团队现已达到 45 人, 正共同推进 AI 能力前沿, 包括验证新想法, 创建新软件系统以及在机器人上部署机器学习.
OpenAI décrit un mode de défaillance de l'apprentissage par renforcement 。
OpenAI annonce la sortie d'Universe, une plateforme logicielle destinée à mesurer et entraîner l'intelligence générale d'une IA à travers les jeux。
OpenAI annonce travailler avec Microsoft pour commencer à exécuter la plupart de ses expériences à grande échelle sur Azure.
OpenAI 发布研究 RL², 提出通过慢速强化学习实现快速强化学习. 原文正文未能获取, 仅保留标题信息.
OpenAI 在其办公室举办了首届自组织机器学习会议, 超过一百五十名 AI 从业者参加.
OpenAI publie un article sur l'infrastructure nécessaire au deep learning。
OpenAI annonce la mise à disposition des dernières informations sur la Machine Learning Unconference via son wiki dédié. Ce wiki sera mis à jour périodiquement avec davantage de contenu pour les participants.
OpenAI 宣布已招聘更多优秀人才以助力实现其目标, 并对新加入的成员表示欢迎.
OpenAI présente ses « special projects », une démarche centrée sur le choix de problèmes scientifiques à fort impact. L'organisation souligne qu'un travail scientifique utile suppose de s'attaquer aux bons problèmes, non seulement intéressants mais dont les solutions ont réellement de l'importance.
OpenAI与Berkeley, Stanford的研究人员共同参与了一篇由Google Brain研究人员主导的论文« Concrete Problems in AI Safety ». 该论文探讨了围绕确保现代机器学习系统按预期运行的诸多研究问题.
OpenAI a défini ses objectifs techniques dans le cadre de sa mission : construire une IA sûre et veiller à ce que ses bénéfices soient répartis de manière aussi large et équitable que possible.
OpenAI 介绍了四个围绕生成模型 (无监督学习的一个分支)展开的项目, 主题分别是增强或使用生成模型. 文章除描述这些工作外, 还解释了生成模型是什么, 为何重要以及未来可能的发展方向.
OpenAI annonce l'arrivée de nouveaux membres dans son équipe et indique qu'elle continue de recruter. L'annonce ne précise ni les noms, ni les postes, ni le nombre des personnes concernées.
OpenAI publie la bêta publique d'OpenAI Gym, une boîte à outils pour développer et comparer des algorithmes d'apprentissage par renforcement. Elle comprend une suite croissante d'environnements, allant de robots simulés à des jeux Atari, ainsi qu'un site pour comparer et reproduire les résultats.
Motif de la recommandation :OpenAI Gym passe en bêta publique avec une suite d'environnements et un site de comparaison, ce qui donne un point de départ concret pour l'apprentissage par renforcement.