跳到正文
原文
arXiv · Machine Learning Theory· Bo-Wen Zhang, Junwei He, Maoqi Liu, Feiran Li, Song-Lin Lv, Wentao Ma, Rongyi Lin, Shuhan Zhong, Lan-Zhe Guo·· 5 小时前AI 评分38

T2SPO:面向智能体强化学习的轨迹到步骤策略优化

T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning

AI 导读

T2SPO 利用成功交互轨迹提供步骤级反馈,通过 TabPFN 回归器估计剩余距离并生成辅助信用信号,在 ALFWorld 和 WebShop 上用 1.5B 与 7B 语言模型实验,相比 GRPO 一致提升任务成功率。

来源:arXiv · Machine Learning Theory · arxiv.org