arXiv · Software Engineering· Xinming Tu (Minta), Tianze Wang (Minta), Yingzhou (Minta), Lu, Kexin Huang, Yuanhao Qu, Sara Mostafavi·· 16 小时前AI 评分46
谁来守护评测基准?LLM 智能体基准的自动化审计
Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks
AI 导读
论文提出 BenchGuard,首个对执行式智能体基准进行跨工件联合审计的框架,用前沿 LLM 按结构化协议交叉验证基准工件,可选地纳入智能体解法或执行轨迹作为诊断证据。
来源:arXiv · Software Engineering · arxiv.org