arXiv · Computation and Language· Dongwon Jung, Hemanth Neelgund Ramesh, Yifan Wang, Xiaomin Li, Yuexing Hao, Yu Hu, Muhao Chen, Varun Chandrasekaran, Andrzej Banburski-Fahey, Jaron Lanier·· 6 小时前AI 评分42
ProVer:面向智能体强化学习的关键决策信用分配方法
Targeting Pivotal Decisions for Credit Assignment in Agentic Reinforcement Learning
AI 导读
ProVer 框架针对智能体强化学习中的信用分配问题,通过对比成功与失败轨迹定位关键决策段,并利用段前后成功率差异验证其优势,正向估计纳入 GRPO 优势更新。在 ALFWorld、WebShop 和 SearchQA 上,ProVer 相对 GRPO 提升 Qwen3.5-2B 9.91%、Qwen3.5-4B 7.12%,以有限生成开销实现选择性关键决策定位。
来源:arXiv · Computation and Language · arxiv.org