Aller au contenu
7mois30jourlundi
7mois18jourmercredi
7mois9jourlundi
  1. OpenAI News58

    Glow : de meilleurs modèles génératifs réversibles

    OpenAI présente Glow, un modèle génératif réversible qui utilise des convolutions 1x1 inversibles. Il étend les travaux antérieurs sur les modèles génératifs réversibles et simplifie l'architecture. Le modèle peut générer des images réalistes à haute résolution, prend en charge un échantillonnage efficace et découvre des caractéristiques permettant de manipuler les attributs des données. Le code du modèle et un outil de visualisation en ligne sont publiés.

7mois4jourmercredi
  1. OpenAI News78

    OpenAI apprend Montezuma's Revenge à un agent à partir d'une seule démonstration

    OpenAI a entraîné un agent à atteindre un score élevé de 74 500 sur Montezuma's Revenge à partir d'une seule démonstration humaine。

    Motif de la recommandation :L'article explique comment un agent atteint 74 500 points sur Montezuma's Revenge à partir d'une seule démonstration, avec un algorithme simple fondé sur PPO.

6mois25jourlundi
6mois22jourvendredi
6mois11jourlundi
5mois25jourvendredi
  1. OpenAI News62

    OpenAI publie la version complète de Gym Retro

    OpenAI publie la version complète de Gym Retro, une plateforme de recherche en apprentissage par renforcement sur les jeux. Le nombre de jeux publics passe d'environ 70 jeux Atari et 30 jeux Sega à plus de 1000 jeux couvrant plusieurs émulateurs sous-jacents. OpenAI publie également l'outil utilisé pour ajouter de nouveaux jeux à la plateforme.

    Motif de la recommandation :OpenAI ouvre une plateforme d'apprentissage par renforcement sur plus de 1000 jeux et publie l'outil d'ajout de jeux, ce qui permet de mesurer l'évolution de l'échelle des environnements disponibles.

5mois16jourmercredi
  1. OpenAI News85

    OpenAI analyse la croissance exponentielle du calcul d'entraînement en IA

    OpenAI publie une analyse montrant que depuis 2012, la quantité de calcul utilisée dans les plus grands entraînements d'IA croît de façon exponentielle avec un temps de doublement de 3。

    Motif de la recommandation :L'analyse quantifie la croissance exponentielle du calcul d'entraînement depuis 2012 et son rythme de doublement, un repère pour situer les capacités des futurs systèmes.

5mois3jourjeudi
4mois18jourmercredi
  1. OpenAI News22

    OpenAI publie Evolved Policy Gradients, une approche de méta-apprentissage par évolution de la fonction de perte

    OpenAI publie Evolved Policy Gradients (EPG), une approche expérimentale de méta-apprentissage qui fait évoluer la fonction de perte des agents d'apprentissage afin de permettre un entraînement rapide sur de nouvelles tâches. Les agents entraînés avec EPG réussissent à l'évaluation des tâches de base hors de leur régime d'entraînement, comme apprendre à naviguer vers un objet situé du côté opposé de la pièce par rapport à sa position pendant l'entraînement.

4mois5jourjeudi
3mois7jourmercredi
2mois26jourlundi
2mois20jourmardi
2mois15jourjeudi
  1. OpenAI News22

    OpenAI : l'apprentissage automatique interprétable par l'enseignement

    OpenAI a conçu une méthode où les IA s'enseignent mutuellement à l'aide d'exemples compréhensibles pour les humains. L'approche sélectionne automatiquement les exemples les plus informatifs pour enseigner un concept, comme les meilleures images illustrant la notion de chien. Les expériences menées montrent que cette méthode est efficace pour enseigner aussi bien aux IA qu'aux humains.

2mois7jourmercredi
1mois31jourmercredi
10mois26jourjeudi
10mois19jourjeudi
10mois11jourmercredi
9mois14jourjeudi
8mois18jourvendredi
8mois16jourmercredi
  1. OpenAI News0

    OpenAI 关于 Dota 2 的更多进展

    OpenAI 的 Dota 2 结果表明, 在算力充足时, 自我博弈可将机器学习系统从远低于人类水平提升至超人水平. 该系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手, 此后仍在持续提升. 与受限于训练数据集的监督式深度学习不同, 自我博弈系统的可用数据会随智能体变强而自动改进.

8mois11jourvendredi
  1. OpenAI News88

    OpenAI crée un bot qui bat les meilleurs joueurs professionnels de Dota 2 en 1v1

    OpenAI a créé un bot qui bat les meilleurs joueurs professionnels du monde lors de matchs 1v1 de Dota 2 selon les règles standard des tournois. Le bot a appris le jeu à partir de zéro par auto-apprentissage, sans utiliser d'apprentissage par imitation ni de recherche arborescente. OpenAI présente cette avancée comme une étape vers la construction de systèmes d'IA capables d'accomplir des objectifs bien définis dans des situations complexes et désordonnées impliquant de vrais humains.

    Motif de la recommandation :L'article explique comment un bot a appris Dota 2 par auto-apprentissage et a battu des joueurs professionnels, ce qui permet de comprendre les capacités et les limites de l'apprentissage autonome dans des environnements complexes.

7mois27jourjeudi
7mois20jourjeudi
  1. OpenAI News85

    OpenAI 发布强化学习算法 PPO

    OpenAI 发布了一类新的强化学习算法 Proximal Policy Optimization (PPO), 其表现与当时最先进方法相当或更好, 同时实现和调参都简单得多. PPO 因易用且性能良好, 已成为 OpenAI 默认使用的强化学习算法.

    Motif de la recommandation :OpenAI 公开了 PPO 这一强化学习算法的定位与内部采用情况, 可了解其相对已有方法的取舍.

7mois17jourlundi
6mois13jourmardi
  1. OpenAI News0

    OpenAI与DeepMind合作开发从人类偏好中学习的算法

    OpenAI与DeepMind安全团队合作开发出一种算法, 通过让人类在两种候选行为中指出哪个更好, 来推断人类的目标, 从而避免手工编写目标函数. 该方法旨在消除人工编写目标函数的需求, 因为用简单代理替代复杂目标或目标设定稍有偏差, 都可能导致不良甚至危险的行为. 这是构建安全AI系统方向上的一步.

6mois8jourjeudi
5mois24jourmercredi
  1. OpenAI News62

    OpenAI Baselines : DQN

    OpenAI annonce l'open source d'OpenAI Baselines, son effort interne pour reproduire des algorithmes d'apprentissage par renforcement avec des performances comparables aux résultats publiés. Les algorithmes seront publiés au cours des prochains mois ; la version du jour inclut DQN et trois de ses variantes.

    Motif de la recommandation :OpenAI ouvre le code de ses implémentations d'algorithmes d'apprentissage par renforcement, avec des performances alignées sur les résultats publiés.

5mois16jourmardi
4mois6jourjeudi
3mois24jourvendredi
3mois20jourlundi
3mois16jourjeudi
2mois24jourvendredi
12mois21jourmercredi
12mois5jourlundi