arXiv · Computation and Language· Naen Xu, Wanqing Cui, Yibo Hu, Shixin Hong, Hengyu An, Meiguang Jin, Junfeng Ma, Tianyu Du·· 3 小时前AI 评分39
StateTree:通过强化学习增强长期对话推理能力
StateTree: Enhancing Long-Term Dialogue Reasoning via Reinforcement Learning
AI 导读
StateTree 是一种基于数据驱动的强化学习方法,通过构建树结构路径追踪任务来增强长期对话推理能力。该方法在 10K-token 上下文上训练,可泛化至 128K tokens,StateTree-7B 在 LongMemEval (128k) 上提升达 +23.60%,StateTree-14B 取得 59.00% 准确率,超越 QwenLong-L1-32B 的 45.20%。
来源:arXiv · Computation and Language · arxiv.org