跳到正文
原文
arXiv · Machine Learning Theory· Ganghun Lee, Minji Kim, Minsu Lee, Byoung-Tak Zhang·· 16 小时前AI 评分33

奖励膨胀:强化学习的健康刺激

Reward Inflation: A Healthy Stimulus for Reinforcement Learning

AI 导读

论文提出奖励膨胀(reward inflation),即在强化学习训练过程中逐步放大奖励幅度,作为一种健康的训练刺激。理论上它会在策略更新中引入隐式近因加权、加速适应,并在策略饱和时维持梯度信号、抑制休眠神经元、保持可塑性。在 ALE 游戏与 MuJoCo 任务上的实验显示,适当的奖励膨胀对广泛任务有益;自适应变体 Fed 可动态调节膨胀水平,通常优于固定膨胀。

来源:arXiv · Machine Learning Theory · arxiv.org