跳到正文
原文
arXiv · Machine Learning· Hsiao-Ru Pan, Florent Draye, Bernhard Sch\"olkopf·· 6 小时前AI 评分33

ABC:基于优势函数的控制变量法用于可验证奖励强化学习

ABC: Advantage-Based Control Variates for Reinforcement Learning with Verifiable Rewards

AI 导读

ABC(Advantage-Based Control Variates)通过优势-价值公式重新审视轨迹级控制变量,与 Direct Advantage Estimation(DAE)结合成单一 actor-critic 算法。

来源:arXiv · Machine Learning · arxiv.org