arXiv · Machine Learning Theory· Xinjie Liu, Ruihan Zhao, Anirban Chaudhuri, Cyrus Neary, Ufuk Topcu, David Fridovich-Keil·· 16 小时前AI 评分39
多保真策略梯度 MFPG-PPO 稳定数据稀缺强化学习
Multi-Fidelity Policy Gradients Stabilize Data-Scarce Reinforcement Learning
AI 导读
研究者将多保真策略梯度(MFPG)框架扩展到现代 actor-critic 学习,提出 MFPG-PPO 与预算感知版本,用低成本低保真数据构造控制变量以降低方差、避免策略梯度估计偏差。
来源:arXiv · Machine Learning Theory · arxiv.org