OpenAI entraîne une main robotique humanoïde à manipuler des objets avec une dextérité inédite
OpenAI indique avoir entraîné une main robotique humanoïde à manipuler des objets physiques avec une dextérité inédite.
OpenAI indique avoir entraîné une main robotique humanoïde à manipuler des objets physiques avec une dextérité inédite.
Le match de benchmark OpenAI Five est terminé.
OpenAI présente Glow, un modèle génératif réversible qui utilise des convolutions 1x1 inversibles. Il étend les travaux antérieurs sur les modèles génératifs réversibles et simplifie l'architecture. Le modèle peut générer des images réalistes à haute résolution, prend en charge un échantillonnage efficace et découvre des caractéristiques permettant de manipuler les attributs des données. Le code du modèle et un outil de visualisation en ligne sont publiés.
OpenAI a entraîné un agent à atteindre un score élevé de 74 500 sur Montezuma's Revenge à partir d'une seule démonstration humaine。
Motif de la recommandation :L'article explique comment un agent atteint 74 500 points sur Montezuma's Revenge à partir d'une seule démonstration, avec un algorithme simple fondé sur PPO.
L'équipe de cinq réseaux neuronaux OpenAI Five a commencé à battre des équipes humaines amateurs sur Dota 2.
OpenAI a publié les résultats de la première édition du Retro Contest。
OpenAI a obtenu des résultats de pointe sur une série de tâches linguistiques variées avec un système évolutif et agnostique à la tâche。
OpenAI publie la version complète de Gym Retro, une plateforme de recherche en apprentissage par renforcement sur les jeux. Le nombre de jeux publics passe d'environ 70 jeux Atari et 30 jeux Sega à plus de 1000 jeux couvrant plusieurs émulateurs sous-jacents. OpenAI publie également l'outil utilisé pour ajouter de nouveaux jeux à la plateforme.
Motif de la recommandation :OpenAI ouvre une plateforme d'apprentissage par renforcement sur plus de 1000 jeux et publie l'outil d'ajout de jeux, ce qui permet de mesurer l'évolution de l'échelle des environnements disponibles.
OpenAI publie une analyse montrant que depuis 2012, la quantité de calcul utilisée dans les plus grands entraînements d'IA croît de façon exponentielle avec un temps de doublement de 3。
Motif de la recommandation :L'analyse quantifie la croissance exponentielle du calcul d'entraînement depuis 2012 et son rythme de doublement, un repère pour situer les capacités des futurs systèmes.
OpenAI propose une technique de sécurité de l'IA qui entraîne des agents à débattre entre eux sur un sujet, un humain jugeant qui gagne.
Motif de la recommandation :L'article expose une piste d'alignement où des agents débattent sous supervision humaine, utile pour situer les approches de sécurité de l'IA.
OpenAI publie Evolved Policy Gradients (EPG), une approche expérimentale de méta-apprentissage qui fait évoluer la fonction de perte des agents d'apprentissage afin de permettre un entraînement rapide sur de nouvelles tâches. Les agents entraînés avec EPG réussissent à l'évaluation des tâches de base hors de leur régime d'entraînement, comme apprendre à naviguer vers un objet situé du côté opposé de la pièce par rapport à sa position pendant l'entraînement.
OpenAI lance le Retro Contest, un concours de transfer learning qui mesure la capacité d'un algorithme d'apprentissage par renforcement à généraliser à partir d'expériences antérieures.
OpenAI a développé Reptile, un algorithme de méta-apprentissage scalable qui échantillonne répétitivement une tâche。
OpenAI met à disposition huit environnements de robotique simulée ainsi qu'une implémentation Baselines de Hindsight Experience Replay。
OpenAI annonce avoir co-écrit un article qui anticipe la manière dont des acteurs malveillants pourraient détourner la technologie IA。
OpenAI a conçu une méthode où les IA s'enseignent mutuellement à l'aide d'exemples compréhensibles pour les humains. L'approche sélectionne automatiquement les exemples les plus informatifs pour enseigner un concept, comme les meilleures images illustrant la notion de chien. Les expériences menées montrent que cette méthode est efficace pour enseigner aussi bien aux IA qu'aux humains.
OpenAI a construit un système qui détermine automatiquement quel objet désigne un mot en faisant décider un réseau de neurones si ce mot appartient à chacun d'environ 100 « types » découverts automatiquement, des catégories non exclusives.
OpenAI 发布 Requests for Research 2.0, 公开了七道在其研究过程中遇到的未解难题. 该批次问题源自 OpenAI 自身研究实践, 面向外部研究者开放.
OpenAI a mis au point un algorithme d'apprentissage par renforcement hiérarchique qui apprend des actions de haut niveau utiles à la résolution de diverses tâches。
OpenAI a mis au point des techniques robotiques permettant à des contrôleurs entraînés entièrement en simulation。
Un agent de méta-apprentissage parvient à vaincre rapidement un agent adverse plus fort non méta-apprenant dans une tâche de lutte de robots simulés. Le même agent peut s'adapter à une défaillance physique.
OpenAI a découvert que l'auto-jeu permet à des IA simulées d'acquérir des compétences physiques comme le plaquage。
OpenAI publie LOLA (Learning with Opponent-Learning Awareness)。
OpenAI publie deux nouvelles implémentations dans OpenAI Baselines : ACKTR et A2C. A2C est une variante synchrone et déterministe d'A3C (Asynchronous Advantage Actor Critic)。
OpenAI 的 Dota 2 结果表明, 在算力充足时, 自我博弈可将机器学习系统从远低于人类水平提升至超人水平. 该系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手, 此后仍在持续提升. 与受限于训练数据集的监督式深度学习不同, 自我博弈系统的可用数据会随智能体变强而自动改进.
OpenAI a créé un bot qui bat les meilleurs joueurs professionnels du monde lors de matchs 1v1 de Dota 2 selon les règles standard des tournois. Le bot a appris le jeu à partir de zéro par auto-apprentissage, sans utiliser d'apprentissage par imitation ni de recherche arborescente. OpenAI présente cette avancée comme une étape vers la construction de systèmes d'IA capables d'accomplir des objectifs bien définis dans des situations complexes et désordonnées impliquant de vrais humains.
Motif de la recommandation :L'article explique comment un bot a appris Dota 2 par auto-apprentissage et a battu des joueurs professionnels, ce qui permet de comprendre les capacités et les limites de l'apprentissage autonome dans des environnements complexes.
OpenAI a constaté que l'ajout d'un bruit adaptatif aux paramètres des algorithmes d'apprentissage par renforcement améliore fréquemment les performances. Cette méthode d'exploration est simple à implémenter et ne dégrade que très rarement les résultats, ce qui la rend intéressante à tester sur tout problème.
OpenAI 发布了一类新的强化学习算法 Proximal Policy Optimization (PPO), 其表现与当时最先进方法相当或更好, 同时实现和调参都简单得多. PPO 因易用且性能良好, 已成为 OpenAI 默认使用的强化学习算法.
Motif de la recommandation :OpenAI 公开了 PPO 这一强化学习算法的定位与内部采用情况, 可了解其相对已有方法的取舍.
OpenAI 创建了在不同尺度和视角下都能可靠欺骗神经网络分类器的图像, 直接挑战了上周提出的观点, 即自动驾驶汽车因从多尺度, 多角度, 多视角等采集图像而难以被恶意欺骗.
OpenAI与DeepMind安全团队合作开发出一种算法, 通过让人类在两种候选行为中指出哪个更好, 来推断人类的目标, 从而避免手工编写目标函数. 该方法旨在消除人工编写目标函数的需求, 因为用简单代理替代复杂目标或目标设定稍有偏差, 都可能导致不良甚至危险的行为. 这是构建安全AI系统方向上的一步.
OpenAI explore les environnements multi-agents où des agents rivalisent pour des ressources。
OpenAI annonce l'open source d'OpenAI Baselines, son effort interne pour reproduire des algorithmes d'apprentissage par renforcement avec des performances comparables aux résultats publiés. Les algorithmes seront publiés au cours des prochains mois ; la version du jour inclut DQN et trois de ses variantes.
Motif de la recommandation :OpenAI ouvre le code de ses implémentations d'algorithmes d'apprentissage par renforcement, avec des performances alignées sur les résultats publiés.
OpenAI indique avoir créé un système robotique entraîné entièrement en simulation et déployé sur un robot physique, capable d'apprendre une nouvelle tâche après l'avoir vue réalisée une fois.
OpenAI 开发了一个无监督系统, 仅通过预测 Amazon 评论中的下一个字符进行训练, 就学到了对情感的良好表示.
OpenAI indique que les stratégies d'évolution (ES), une technique d'optimisation connue depuis des décennies。
OpenAI annonce soutenir le lancement de Distill, une nouvelle revue consacrée à l'excellente communication des résultats en machine learning, qu'ils soient nouveaux ou existants.
OpenAI 发布新研究, 介绍智能体在其中发展出自身语言. 该帖为摘要, 未提供更多细节.
Les exemples adversariaux sont des entrées conçues intentionnellement par un attaquant pour faire commettre une erreur au modèle d'apprentissage automatique。
OpenAI décrit un mode de défaillance de l'apprentissage par renforcement 。
OpenAI annonce la sortie d'Universe, une plateforme logicielle destinée à mesurer et entraîner l'intelligence générale d'une IA à travers les jeux。