强化学习是近来最热门也是成果最丰富的人工智能领域之一。之前为我们带来《深度强化学习》手稿的加拿大阿尔伯塔大学计算机系博士Yuxi Li 近日发表博文认为我们正迎来强化学习的时代,本文为该文章的中文版。
强化学习(RL)已经取得了斐然的成就,比如 Atari 游戏、AlphaGo、AlphaGo Zero、AlphaZero、DeepStack、Libratus、OpenAI Five、Dactyl、DeepMimic、夺旗,以及学习穿着打扮、冷却数据中心、化学合成、药物设计等。更多强化学习应用请参阅:
其中大多数都是学术研究。但是,我们也正见证着强化学习产品和服务的诞生,比如谷歌的 Cloud AutoML 和 Facebook 的 Horizon,还有 OpenAI Gym、DeepMindLab、DeepMind Control Suite、Google Dopamine、DeepMind TRFL、Facebook ELF、Microsoft TextWorld、Amazon AWS DeepRacer、Intel RL Coach 等开源项目和测试平台。多臂赌博机方面(尤其是情景赌博机(contextual bandits))已有很多成功的应用。
后文将简要介绍强化学习,讨论强化学习近期的成果、问题、研究方向、应用和未来。总体而言想要说明一点:强化学习时代正在到来。