跳到正文
原文
arXiv · Computation and Language· Sergei Polezhaev, Barys Liskavets, Ori Press, Alexander Golubev·· 4 小时前AI 评分48

Caddie:基于任务结果训练 LLM 智能体顾问

Training Advisors for LLM Agents from Task Outcomes

AI 导读

提出 Caddie 方法,通过强化学习训练 critic 模型,在基础模型冻结的条件下依据智能体最终是否成功来生成自然语言分析与建议。在 MuSiQue 基准上,Qwen3-4B critic 使 Qwen3-4B 成功率提升超过 25 个百分点,超越无 critic 的 Kimi K3,并在 τ³ 与 DeepDive 等域外交互基准上零额外训练获得增益。

来源:arXiv · Computation and Language · arxiv.org