OpenAI News·· 2017-06-13AI Score0
OpenAI与DeepMind合作开发从人类偏好中学习的算法
Learning from human preferences
AI Introduction
OpenAI与DeepMind安全团队合作开发出一种算法, 通过让人类在两种候选行为中指出哪个更好, 来推断人类的目标, 从而避免手工编写目标函数. 该方法旨在消除人工编写目标函数的需求, 因为用简单代理替代复杂目标或目标设定稍有偏差, 都可能导致不良甚至危险的行为. 这是构建安全AI系统方向上的一步.
Source :OpenAI News · openai.com