OpenAI Fellows automne 2018 : candidatures ouvertes
OpenAI ouvre les candidatures pour la prochaine cohorte de son programme OpenAI Fellows.
OpenAI ouvre les candidatures pour la prochaine cohorte de son programme OpenAI Fellows.
OpenAI publie la version complète de Gym Retro, une plateforme de recherche en apprentissage par renforcement sur les jeux. Le nombre de jeux publics passe d'environ 70 jeux Atari et 30 jeux Sega à plus de 1000 jeux couvrant plusieurs émulateurs sous-jacents. OpenAI publie également l'outil utilisé pour ajouter de nouveaux jeux à la plateforme.
Motif de la recommandation :OpenAI ouvre une plateforme d'apprentissage par renforcement sur plus de 1000 jeux et publie l'outil d'ajout de jeux, ce qui permet de mesurer l'évolution de l'échelle des environnements disponibles.
OpenAI publie une analyse montrant que depuis 2012, la quantité de calcul utilisée dans les plus grands entraînements d'IA croît de façon exponentielle avec un temps de doublement de 3.
Motif de la recommandation :L'analyse quantifie la croissance exponentielle du calcul d'entraînement depuis 2012 et son rythme de doublement, un repère pour situer les capacités des futurs systèmes.
OpenAI propose une technique de sécurité de l'IA qui entraîne des agents à débattre entre eux sur un sujet, un humain jugeant qui gagne.
Motif de la recommandation :L'article expose une piste d'alignement où des agents débattent sous supervision humaine, utile pour situer les approches de sécurité de l'IA.
OpenAI lance le Retro Contest, un concours de transfert d'apprentissage qui mesure la capacité d'un algorithme de reinforcement learning à généraliser à partir d'expériences antérieures. Le concours évalue donc la généralisation, et non l'apprentissage sur une tâche unique.
OpenAI a organisé le 3 mars son premier hackathon réunissant 100 membres de la communauté de l'intelligence artificielle.
OpenAI a développé Reptile, un algorithme de méta-apprentissage scalable qui échantillonne répétitivement une tâche.
OpenAI lance OpenAI Scholars, un programme offrant 6 à 10 bourses et un mentorat à des personnes issues de groupes sous-représentés pour étudier le deep learning à plein temps pendant 3 mois et publier un projet en open source.
OpenAI met à disposition huit environnements de robotique simulée ainsi qu'une implémentation Baselines de Hindsight Experience Replay.
OpenAI organise le 3 mars un hackathon dans ses bureaux de San Francisco, dans le Mission District, avec des talks au programme. L'événement se déroule un samedi.
OpenAI accueille de nouveaux donateurs, comme l'annonce l'organisation. Le message.
OpenAI annonce avoir co-écrit un article qui anticipe la manière dont des acteurs malveillants pourraient détourner la technologie IA.
OpenAI a conçu une méthode qui encourage les IA à s'enseigner mutuellement à l'aide d'exemples compréhensibles pour les humains. L'approche sélectionne automatiquement les exemples les plus informatifs pour enseigner un concept, comme les meilleures images pour décrire la notion de chien. Les expériences menées montrent que cette méthode est efficace pour enseigner aussi bien aux IA qu'aux humains.
OpenAI a construit un système qui détermine automatiquement à quel objet renvoie un mot en faisant décider à un réseau de neurones si ce mot appartient à chacun d'environ 100 « types » découverts automatiquement, des catégories non exclusives.
OpenAI a mis au point un algorithme d'apprentissage par renforcement hiérarchique qui apprend des actions de haut niveau utiles pour résoudre une gamme de tâches.
OpenAI a mis au point des techniques de robotique permettant à des contrôleurs de robots.
OpenAI a découvert que l'auto-jeu permet à des IA simulées d'acquérir des compétences physiques comme le plaquage.
OpenAI publie Learning with Opponent-Learning Awareness (LOLA).
OpenAI publie deux nouvelles implémentations dans OpenAI Baselines : ACKTR et A2C. A2C est une variante synchrone et déterministe de Asynchronous Advantage Actor Critic (A3C).
OpenAI a créé un bot qui bat les meilleurs joueurs professionnels du monde lors de matchs 1v1 de Dota 2 selon les règles standard des tournois. Le bot a appris le jeu à partir de zéro par auto-apprentissage, sans utiliser d'apprentissage par imitation ni de recherche arborescente. OpenAI présente cette avancée comme une étape vers la construction de systèmes d'IA capables d'accomplir des objectifs bien définis dans des situations complexes et désordonnées impliquant de vrais humains.
Motif de la recommandation :L'article explique comment un bot a appris Dota 2 par auto-apprentissage et a battu des joueurs professionnels, ce qui permet de comprendre les capacités et les limites de l'apprentissage autonome dans des environnements complexes.
OpenAI a publié RL-Teacher, une implémentation open source de son interface permettant d'entraîner des IA via des retours humains occasionnels plutôt que des fonctions de récompense écrites à la main. La technique sous-jacente a été développée comme une étape vers des systèmes d'IA sûrs, et s'applique aussi aux problèmes d'apprentissage par renforcement dont les récompenses sont difficiles à spécifier.
OpenAI a constaté que l'ajout d'un bruit adaptatif aux paramètres des algorithmes d'apprentissage par renforcement améliore fréquemment les performances. Cette méthode d'exploration est simple à implémenter et ne dégrade que très rarement les résultats, ce qui la rend intéressante à tester sur tout problème.
OpenAI open source une bibliothèque Python haute performance dédiée à la simulation robotique, basée sur le moteur MuJoCo et issue d'un an de recherche en robotique.
OpenAI présente les environnements multi-agents où des agents rivalisent pour des ressources comme des étapes vers l'AGI. Ces environnements offrent un curriculum naturel.
OpenAI annonce l'open source d'OpenAI Baselines, son effort interne pour reproduire des algorithmes d'apprentissage par renforcement avec des performances comparables aux résultats publiés. Les algorithmes seront publiés au cours des prochains mois ; la version du jour inclut DQN et trois de ses variantes.
Motif de la recommandation :OpenAI ouvre le code de ses implémentations d'algorithmes d'apprentissage par renforcement, avec des performances alignées sur les résultats publiés.
OpenAI indique avoir créé un système robotique entraîné entièrement en simulation et déployé sur un robot physique, capable d'apprendre une nouvelle tâche après l'avoir vue réalisée une fois.
OpenAI publie Roboschool, un logiciel open source de simulation robotique intégré à OpenAI Gym.
OpenAI a créé le premier robot physique équipé d'une IA de détection de spam entraînée entièrement en simulation. Cette IA, présentée comme une première mondiale, a été déployée sur un robot physique.
OpenAI indique que les stratégies d'évolution (ES), une technique d'optimisation connue depuis des décennies.
OpenAI annonce son soutien au lancement de Distill, une nouvelle revue consacrée à l'excellente communication des résultats en machine learning, qu'ils soient nouveaux ou existants.
OpenAI décrit un mode de défaillance des algorithmes d'apprentissage par renforcement.
OpenAI annonce la sortie d'Universe, une plateforme logicielle destinée à mesurer et entraîner l'intelligence générale d'une IA à travers les jeux.
OpenAI annonce travailler avec Microsoft pour commencer à exécuter la plupart de ses expériences à grande échelle sur Azure.
Le deep learning étant une science empirique, la qualité de l'infrastructure d'une équipe multiplie ses progrès. L'écosystème open source actuel permet à quiconque de construire une excellente infrastructure de deep learning.
OpenAI organise une Machine Learning Unconference dont les dernières informations sont désormais disponibles sur le wiki de l'Unconference. Ce wiki sera mis à jour périodiquement avec davantage d'informations destinées aux participants.
OpenAI a défini ses objectifs techniques dans le cadre de sa mission : construire une IA sûre et veiller à ce que ses bénéfices soient aussi largement et équitablement répartis que possible.
OpenAI annonce l'arrivée de nouveaux membres dans son équipe et indique qu'elle continue de recruter.
OpenAI publie la bêta publique d'OpenAI Gym, une boîte à outils pour développer et comparer des algorithmes d'apprentissage par renforcement. Elle comprend une suite croissante d'environnements, allant de robots simulés à des jeux Atari, ainsi qu'un site pour comparer et reproduire les résultats.
Motif de la recommandation :OpenAI Gym passe en bêta publique avec une suite d'environnements et un site de comparaison, ce qui donne un point de départ concret pour l'apprentissage par renforcement.
OpenAI annonce l'arrivée de Pieter et Shivon au sein de son équipe. L'annonce, publiée sous forme de brève mise à jour d'équipe, ne précise ni les fonctions ni les projets qui leur seront confiés.
OpenAI se présente comme une société de recherche en intelligence artificielle à but non lucratif dont l'objectif est de faire progresser l'intelligence numérique de la manière la plus susceptible de bénéficier à l'humanité tout entière, sans être contrainte par la nécessité de générer un retour financier. Parce que ses recherches sont libres de toute obligation financière, l'organisation peut se concentrer davantage sur un impact humain positif.