arXiv · Machine Learning Theory· Bo-Wen Zhang, Junwei He, Maoqi Liu, Feiran Li, Song-Lin Lv, Wentao Ma, Rongyi Lin, Shuhan Zhong, Lan-Zhe Guo·· 5 小时前AI 评分38
T2SPO:面向智能体强化学习的轨迹到步骤策略优化
T2SPO: Trajectory-to-Step Policy Optimization for Agentic Reinforcement Learning
AI 导读
T2SPO 利用成功交互轨迹提供步骤级反馈,通过 TabPFN 回归器估计剩余距离并生成辅助信用信号,在 ALFWorld 和 WebShop 上用 1.5B 与 7B 语言模型实验,相比 GRPO 一致提升任务成功率。
来源:arXiv · Machine Learning Theory · arxiv.org