跳到正文
原文
arXiv · Software Engineering· Xinming Tu (Minta), Tianze Wang (Minta), Yingzhou (Minta), Lu, Kexin Huang, Yuanhao Qu, Sara Mostafavi·· 16 小时前AI 评分46

谁来守护评测基准?LLM 智能体基准的自动化审计

Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks

AI 导读

论文提出 BenchGuard,首个对执行式智能体基准进行跨工件联合审计的框架,用前沿 LLM 按结构化协议交叉验证基准工件,可选地纳入智能体解法或执行轨迹作为诊断证据。

来源:arXiv · Software Engineering · arxiv.org