arXiv · Machine Learning· Tong Zhao, Reed Li, Yuyang Hu, Yutao Zhu, Haijin Liang, Haibo Shi, Yu Lu, Zhicheng Dou·· 6 小时前精选AI 评分64
StepLearn:LLM 智能体的非参数测试时学习框架
Learn Now, Use Next, Trust Later: Prequential Test-Time Learning for LLM Agents
AI 导读
论文提出 StepLearn,将单步迁移作为假设即时用于下一步,再经跨轮次验证后才持久复用,在 WebArena-Lite 和 ALFWorld 上相对 EvoTest 提升 2.2–12.7 个百分点。
推荐理由
提出了即时使用与跨轮次信任分离的非参数框架,在两个基准上相对最强基线提升最高12.7个百分点。
来源:arXiv · Machine Learning · arxiv.org