arXiv · Software Engineering· Junyu Guo, Shangding Gu, Ming Jin, Javad Lavaei·· 2 小时前精选AI 评分62
Groundability, Not Scale Alone: When Weak Reviewers Can Audit Strong Coding Agents
Groundability, Not Scale Alone: When Weak Reviewers Can Audit Strong Coding Agents
AI 导读
论文研究弱评审能否可靠判断强编码代理的补丁是否解决问题,基于411条执行标注轨迹和101个受控案例。在154条GPT-5.4轨迹上,结构化但未校验的证据同时提升缺陷捕获与误拒率;官方执行证据作为上限诊断后,6位评审中5位在122条留存轨迹上同时改善两项指标,2位全对。
推荐理由
研究指出结构化证据能提升弱评审对强编码代理的缺陷捕获率,但误拒和缺乏官方测试仍是主要瓶颈。
来源:arXiv · Software Engineering · arxiv.org