跳到正文
原文
arXiv · Software Engineering· Xincheng He, Wanli Dong, Zhaoqiang Guo, Yan Liu, Lei Xu·· 3 小时前AI 评分31

SSCBench:评估工具调用型 LLM 智能体故障注入测试的证据有效性

SSCBench: Evaluating the Evidential Validity of Fault-Injection Tests for Tool-Using LLM Agents

AI 导读

SSCBench 提出测量协议,评估工具调用型 LLM 智能体故障注入测试的证据有效性,在两个 τ-bench 环境中覆盖 4 种故障算子、5 种智能体配置、1,191 次故障执行。实验显示,在 44 条最终可见反证的已采纳运行中,仅 17 条在首次使用前收到,27 条在之后收到;自动轨迹分析可恢复采纳,却无法可靠恢复首次错误依赖事件。论文主张应在把采纳解释为失败前报告证据条件与支撑总体。

来源:arXiv · Software Engineering · arxiv.org