arXiv · Software Engineering· Yue Pan, Jiawei Li, Ziyuan Zhang, Xiangxin Zhao, He Ye·· 7 小时前AI 评分39
CRJudgeBench:能否让 AI 识别看似合理但无效的代码审查?
CRJudgeBench: Can AI Detect Plausible but Invalid Code Reviews?
AI 导读
CRJudgeBench 包含 1199 个实例,基于真实 pull request 与专家验证的扰动,覆盖可信与看似合理但不可信的审查评论。基于 Qwen3-Coder-30B-A3B-Instruct 训练的仓库感知智能体 Sentinel 在 359 条测试集上准确率达 76.60%,比 GLM-5.3 高 6.13 个百分点、比基座模型高 19.78 个百分点。
来源:arXiv · Software Engineering · arxiv.org