跳到正文
原文
arXiv · Software Engineering· Shuangjie Yao, Hao Wang, Koushik Sen, Simin Chen, Baishakhi Ray, Dawn Song·· 3 小时前AI 评分53

TestJack:通过评估器演化审计智能体编码基准结果

TestJack: Should you trust the results in coding benchmarks? Agentic Coding Benchmarks Auditing via Evaluator Evolution

AI 导读

TestJack 是一个在固定单元测试之外评估补丁的框架,针对每条试验生成可能违反提示需求的测试,仅保留真实补丁通过的测试并复检失败。轻量版本会深度审计随机抽样试验并复用测试,在 6 个前沿模型和 DeepSWE、SWE Marathon 等 5 个基准上发现约 34.4% 被判正确的试验违反任务需求,解决率由 50.6% 降至 33.2%。

来源:arXiv · Software Engineering · arxiv.org