Aller au contenu
12mois6jourmercredi
  1. OpenAI News62

    OpenAI发布块稀疏GPU内核

    OpenAI发布针对块稀疏权重神经网络的高度优化GPU内核, 根据所选稀疏度, 这些内核的运行速度可比cuBLAS或cuSPARSE快数个数量级. OpenAI表示已用这些内核在文本情感分析以及文本和图像的生成建模中取得当前最优结果.

    Motif de la recommandation :OpenAI公开了面向块稀疏权重网络的GPU内核, 并给出相对cuBLAS与cuSPARSE的数量级加速, 可供关注稀疏训练与推理工程化的读者参考.

10mois26jourjeudi
10mois19jourjeudi
10mois11jourmercredi
9mois14jourjeudi
8mois18jourvendredi
8mois16jourmercredi
  1. OpenAI News0

    OpenAI 关于 Dota 2 的更多进展

    OpenAI 的 Dota 2 结果表明, 在算力充足时, 自我博弈可将机器学习系统从远低于人类水平提升至超人水平. 该系统在一个月内从勉强匹敌高排名玩家进步到击败顶尖职业选手, 此后仍在持续提升. 与受限于训练数据集的监督式深度学习不同, 自我博弈系统的可用数据会随智能体变强而自动改进.

8mois11jourvendredi
  1. OpenAI News88

    OpenAI crée un bot qui bat les meilleurs joueurs professionnels de Dota 2 en 1v1

    OpenAI a créé un bot qui bat les meilleurs joueurs professionnels du monde lors de matchs 1v1 de Dota 2 selon les règles standard des tournois. Le bot a appris le jeu à partir de zéro par auto-apprentissage, sans utiliser d'apprentissage par imitation ni de recherche arborescente. OpenAI présente cette avancée comme une étape vers la construction de systèmes d'IA capables d'accomplir des objectifs bien définis dans des situations complexes et désordonnées impliquant de vrais humains.

    Motif de la recommandation :L'article explique comment un bot a appris Dota 2 par auto-apprentissage et a battu des joueurs professionnels, ce qui permet de comprendre les capacités et les limites de l'apprentissage autonome dans des environnements complexes.

8mois3jourjeudi
  1. OpenAI News52

    OpenAI publie RL-Teacher, une implémentation open source pour entraîner les IA via des retours humains

    OpenAI a publié RL-Teacher, une implémentation open source de son interface permettant d'entraîner des IA via des retours humains occasionnels plutôt que des fonctions de récompense écrites à la main. La technique sous-jacente a été développée comme une étape vers des systèmes d'IA sûrs, et s'applique aussi aux problèmes d'apprentissage par renforcement dont les récompenses sont difficiles à spécifier.

7mois27jourjeudi
7mois20jourjeudi
  1. OpenAI News85

    OpenAI 发布强化学习算法 PPO

    OpenAI 发布了一类新的强化学习算法 Proximal Policy Optimization (PPO), 其表现与当时最先进方法相当或更好, 同时实现和调参都简单得多. PPO 因易用且性能良好, 已成为 OpenAI 默认使用的强化学习算法.

    Motif de la recommandation :OpenAI 公开了 PPO 这一强化学习算法的定位与内部采用情况, 可了解其相对已有方法的取舍.

7mois17jourlundi
6mois28jourmercredi
6mois13jourmardi
  1. OpenAI News0

    OpenAI与DeepMind合作开发从人类偏好中学习的算法

    OpenAI与DeepMind安全团队合作开发出一种算法, 通过让人类在两种候选行为中指出哪个更好, 来推断人类的目标, 从而避免手工编写目标函数. 该方法旨在消除人工编写目标函数的需求, 因为用简单代理替代复杂目标或目标设定稍有偏差, 都可能导致不良甚至危险的行为. 这是构建安全AI系统方向上的一步.

6mois8jourjeudi
5mois24jourmercredi
  1. OpenAI News62

    OpenAI Baselines : DQN

    OpenAI annonce l'open source d'OpenAI Baselines, son effort interne pour reproduire des algorithmes d'apprentissage par renforcement avec des performances comparables aux résultats publiés. Les algorithmes seront publiés au cours des prochains mois ; la version du jour inclut DQN et trois de ses variantes.

    Motif de la recommandation :OpenAI ouvre le code de ses implémentations d'algorithmes d'apprentissage par renforcement, avec des performances alignées sur les résultats publiés.

5mois16jourmardi
5mois15jourlundi
4mois6jourjeudi
4mois1joursamedi
3mois24jourvendredi
3mois20jourlundi
3mois16jourjeudi
2mois24jourvendredi
1mois30jourlundi
12mois21jourmercredi
12mois5jourlundi
11mois15jourmardi
11mois9jourmercredi
10mois13jourjeudi
8mois29jourlundi
8mois18jourjeudi
8mois16jourmardi
7mois28jourjeudi
6mois21jourmardi
6mois20jourlundi
6mois16jourjeudi
5mois25jourmercredi
4mois27jourmercredi
  1. OpenAI News70

    OpenAI Gym entre en bêta publique

    OpenAI publie la bêta publique d'OpenAI Gym, une boîte à outils pour développer et comparer des algorithmes d'apprentissage par renforcement. Elle comprend une suite croissante d'environnements, allant de robots simulés à des jeux Atari, ainsi qu'un site pour comparer et reproduire les résultats.

    Motif de la recommandation :OpenAI Gym passe en bêta publique avec une suite d'environnements et un site de comparaison, ce qui donne un point de départ concret pour l'apprentissage par renforcement.