跳到正文
原文
arXiv · Statistics Machine Learning· Sebastian Sanokowski, Alireza Sarmadi, Majid Khadiv·· 3 小时前AI 评分18

FERPO:前向熵正则化策略优化

FERPO: Forward Entropy-Regularized Policy Optimization

AI 导读

FERPO 是一种在线最大熵强化学习算法,通过 critic 值进行策略改进,无需对 critic 求动作梯度。算法利用熵和 KL 散度正则化推导目标动作分布,并通过前向 KL 目标与自归一化重要性采样(SNIS)拟合策略,鼓励覆盖多个高价值模式以促进探索。

来源:arXiv · Statistics Machine Learning · arxiv.org