跳到正文
原文
arXiv · Software Engineering· Rohith Reddy Bellibatlu, Zichong Wang, Wenbin Zhang·· 6 小时前精选AI 评分73

Agent 基准测试是否名副其实?工具型 Agent 环境的可执行契约审计

Do Agent Benchmarks Do What They Say? An Executable-Contract Audit of Tool-Using Agent Environments

AI 导读

论文对 4 个基准中的 34 个可变工具进行可执行契约审计,确认 7 个工具缺陷和 1 个评估器属性。审计将工具接口视为契约,在 25 条标记中无误报、标记 2/5 个负例,并在 33 个漏分中的 29 个发现契约条款未覆盖缺陷。

推荐理由

把工具接口当作可执行契约来审计基准,给出了可复现的缺陷发现路径。

来源:arXiv · Software Engineering · arxiv.org