OpenAI développe un algorithme d'apprentissage par renforcement hiérarchique
OpenAI a mis au point un algorithme d'apprentissage par renforcement hiérarchique qui apprend des actions de haut niveau utiles pour résoudre une gamme de tâches.
OpenAI a mis au point un algorithme d'apprentissage par renforcement hiérarchique qui apprend des actions de haut niveau utiles pour résoudre une gamme de tâches.
OpenAI a mis au point des techniques de robotique permettant à des contrôleurs de robots.
OpenAI a découvert que l'auto-jeu permet à des IA simulées d'acquérir des compétences physiques comme le plaquage.
OpenAI publie Learning with Opponent-Learning Awareness (LOLA).
OpenAI publie deux nouvelles implémentations dans OpenAI Baselines : ACKTR et A2C. A2C est une variante synchrone et déterministe de Asynchronous Advantage Actor Critic (A3C).
OpenAI a créé un bot qui bat les meilleurs joueurs professionnels du monde lors de matchs 1v1 de Dota 2 selon les règles standard des tournois. Le bot a appris le jeu à partir de zéro par auto-apprentissage, sans utiliser d'apprentissage par imitation ni de recherche arborescente. OpenAI présente cette avancée comme une étape vers la construction de systèmes d'IA capables d'accomplir des objectifs bien définis dans des situations complexes et désordonnées impliquant de vrais humains.
Motif de la recommandation :L'article explique comment un bot a appris Dota 2 par auto-apprentissage et a battu des joueurs professionnels, ce qui permet de comprendre les capacités et les limites de l'apprentissage autonome dans des environnements complexes.
OpenAI a publié RL-Teacher, une implémentation open source de son interface permettant d'entraîner des IA via des retours humains occasionnels plutôt que des fonctions de récompense écrites à la main. La technique sous-jacente a été développée comme une étape vers des systèmes d'IA sûrs, et s'applique aussi aux problèmes d'apprentissage par renforcement dont les récompenses sont difficiles à spécifier.
OpenAI a constaté que l'ajout d'un bruit adaptatif aux paramètres des algorithmes d'apprentissage par renforcement améliore fréquemment les performances. Cette méthode d'exploration est simple à implémenter et ne dégrade que très rarement les résultats, ce qui la rend intéressante à tester sur tout problème.
OpenAI open source une bibliothèque Python haute performance dédiée à la simulation robotique, basée sur le moteur MuJoCo et issue d'un an de recherche en robotique.
OpenAI présente les environnements multi-agents où des agents rivalisent pour des ressources comme des étapes vers l'AGI. Ces environnements offrent un curriculum naturel.
OpenAI annonce l'open source d'OpenAI Baselines, son effort interne pour reproduire des algorithmes d'apprentissage par renforcement avec des performances comparables aux résultats publiés. Les algorithmes seront publiés au cours des prochains mois ; la version du jour inclut DQN et trois de ses variantes.
Motif de la recommandation :OpenAI ouvre le code de ses implémentations d'algorithmes d'apprentissage par renforcement, avec des performances alignées sur les résultats publiés.
OpenAI indique avoir créé un système robotique entraîné entièrement en simulation et déployé sur un robot physique, capable d'apprendre une nouvelle tâche après l'avoir vue réalisée une fois.
OpenAI publie Roboschool, un logiciel open source de simulation robotique intégré à OpenAI Gym.
OpenAI a créé le premier robot physique équipé d'une IA de détection de spam entraînée entièrement en simulation. Cette IA, présentée comme une première mondiale, a été déployée sur un robot physique.
OpenAI indique que les stratégies d'évolution (ES), une technique d'optimisation connue depuis des décennies.
OpenAI annonce son soutien au lancement de Distill, une nouvelle revue consacrée à l'excellente communication des résultats en machine learning, qu'ils soient nouveaux ou existants.
OpenAI décrit un mode de défaillance des algorithmes d'apprentissage par renforcement.
OpenAI annonce la sortie d'Universe, une plateforme logicielle destinée à mesurer et entraîner l'intelligence générale d'une IA à travers les jeux.
OpenAI annonce travailler avec Microsoft pour commencer à exécuter la plupart de ses expériences à grande échelle sur Azure.
Le deep learning étant une science empirique, la qualité de l'infrastructure d'une équipe multiplie ses progrès. L'écosystème open source actuel permet à quiconque de construire une excellente infrastructure de deep learning.
OpenAI organise une Machine Learning Unconference dont les dernières informations sont désormais disponibles sur le wiki de l'Unconference. Ce wiki sera mis à jour périodiquement avec davantage d'informations destinées aux participants.
OpenAI a défini ses objectifs techniques dans le cadre de sa mission : construire une IA sûre et veiller à ce que ses bénéfices soient aussi largement et équitablement répartis que possible.
OpenAI annonce l'arrivée de nouveaux membres dans son équipe et indique qu'elle continue de recruter.
OpenAI publie la bêta publique d'OpenAI Gym, une boîte à outils pour développer et comparer des algorithmes d'apprentissage par renforcement. Elle comprend une suite croissante d'environnements, allant de robots simulés à des jeux Atari, ainsi qu'un site pour comparer et reproduire les résultats.
Motif de la recommandation :OpenAI Gym passe en bêta publique avec une suite d'environnements et un site de comparaison, ce qui donne un point de départ concret pour l'apprentissage par renforcement.
OpenAI annonce l'arrivée de Pieter et Shivon au sein de son équipe. L'annonce, publiée sous forme de brève mise à jour d'équipe, ne précise ni les fonctions ni les projets qui leur seront confiés.
OpenAI se présente comme une société de recherche en intelligence artificielle à but non lucratif dont l'objectif est de faire progresser l'intelligence numérique de la manière la plus susceptible de bénéficier à l'humanité tout entière, sans être contrainte par la nécessité de générer un retour financier. Parce que ses recherches sont libres de toute obligation financière, l'organisation peut se concentrer davantage sur un impact humain positif.