Lilian Weng·· 2018-04-08AI 评分12
Policy Gradient Algorithms
Policy Gradient Algorithms
AI 导读
策略梯度是解决强化学习问题的方法之一。文章系统梳理了包括 PPO、SAC、D4PG、TD3、SVPG、IMPALA、PPG 在内的多种策略梯度算法,并总结了降低方差、经验回放、目标网络、熵正则等共性设计原则。IMPALA 通过解耦执行与学习、利用 V-trace 离策略校正实现高吞吐训练。
来源:Lilian Weng · lilianweng.github.io