arXiv · Artificial Intelligence· Shuyao Xiao, Shengling Wang, Xuan Chen, Ke Chao, Ming Cui, Feifei Qian, Chaoyang Mei, Fanlin Meng, Ziming Yu, Junxi Yin·· 3 小时前AI 评分53
LLM 智能体恢复操作的因果评估:当 Harness 失去信号时
When Harnesses Lose the Signal: Causal Evaluation of Recovery in LLM Agents
AI 导读
论文提出将 LLM 智能体的错误恢复建模为因果决策问题,通过比较同一状态下有/无恢复的结果来区分救援与伤害。在长 horizon ALFWorld 任务上,Qwen3-14B 结合 CIR 将成功率从 70.33% 提升至 73.33%,且未干扰任何观测正确的轨迹。
来源:arXiv · Artificial Intelligence · arxiv.org