跳到正文
原文
arXiv · Machine Learning Theory· Xinjie Liu, Ruihan Zhao, Anirban Chaudhuri, Cyrus Neary, Ufuk Topcu, David Fridovich-Keil·· 16 小时前AI 评分39

多保真策略梯度 MFPG-PPO 稳定数据稀缺强化学习

Multi-Fidelity Policy Gradients Stabilize Data-Scarce Reinforcement Learning

AI 导读

研究者将多保真策略梯度(MFPG)框架扩展到现代 actor-critic 学习,提出 MFPG-PPO 与预算感知版本,用低成本低保真数据构造控制变量以降低方差、避免策略梯度估计偏差。

来源:arXiv · Machine Learning Theory · arxiv.org