arXiv · Computation and Language· Wenyu Huang, Xinyu Hou, Pavlos Vougiouklis, Ruofei Lai, Jeff Z. Pan·· 4 小时前AI 评分37
搜索智能体如何超越结果奖励:构建与分配检索信用
Beyond Outcome Rewards: Constructing and Assigning Retrieval Credit for Search Agents
AI 导读
论文系统研究中间监督如何改进搜索智能体的强化学习,考察多种从中间检索步骤提供学习信号的奖励塑形与信用分配策略,并构建一个将中间信号与最终结果奖励结合的训练框架。在多个基准、匹配训练条件下,实验显示聚合搜索智能体性能提升,中间信号的选择及其信用分配位置都会影响训练行为,表明奖励设计与信用分配是训练有效搜索智能体的重要设计维度。
来源:arXiv · Computation and Language · arxiv.org