arXiv · Software Engineering· Junyu Guo, Shangding Gu, Ming Jin, Javad Lavaei·· 3 hr agoSelectedAI score62
Groundability, Not Scale Alone: When Weak Reviewers Can Audit Strong Coding Agents
Groundability, Not Scale Alone: When Weak Reviewers Can Audit Strong Coding Agents
AI brief
论文研究弱评审能否可靠判断强编码代理的补丁是否解决问题,基于411条执行标注轨迹和101个受控案例。在154条GPT-5.4轨迹上,结构化但未校验的证据同时提升缺陷捕获与误拒率;官方执行证据作为上限诊断后,6位评审中5位在122条留存轨迹上同时改善两项指标,2位全对。
Why it matters
研究指出结构化证据能提升弱评审对强编码代理的缺陷捕获率,但误拒和缺乏官方测试仍是主要瓶颈。
Source: arXiv · Software Engineering · arxiv.org