arXiv · Computation and Language· Hongzhan Lin, Shidong Cao, Ziyang Luo, Wenhao Chai, Mong-Li Lee, Wynne Hsu·· 4 hr agoAI score53
SafeActBench:工具调用智能体如何从证据走向行动并失败
From Evidence to Action: How Tool-Using Agents Fail
AI brief
论文提出 SafeActBench,包含 656 个案例、六个操作领域和五种协议,用于分析工具调用智能体在证据到行动链条中的失败。研究覆盖十种模型与 harness 配置,发现静态动作评估较强而交互执行较弱,失败常发生在执行前的调查不完整或证据未建立阶段;单动作执行通常可靠,多动作流程还会暴露前置条件未解决和执行不完整。
Source: arXiv · Computation and Language · arxiv.org