OpenAI News·· 2017-07-20sélectionAI Score85
OpenAI 发布强化学习算法 PPO
Proximal Policy Optimization
AI Introduction
OpenAI 发布了一类新的强化学习算法 Proximal Policy Optimization (PPO), 其表现与当时最先进方法相当或更好, 同时实现和调参都简单得多. PPO 因易用且性能良好, 已成为 OpenAI 默认使用的强化学习算法.
Raison de la recommandation
OpenAI 公开了 PPO 这一强化学习算法的定位与内部采用情况, 可了解其相对已有方法的取舍.
Source :OpenAI News · openai.com