跳到正文
原文
arXiv · Software Engineering· Yue Pan, Jiawei Li, Ziyuan Zhang, Xiangxin Zhao, He Ye·· 7 小时前AI 评分39

CRJudgeBench:能否让 AI 识别看似合理但无效的代码审查?

CRJudgeBench: Can AI Detect Plausible but Invalid Code Reviews?

AI 导读

CRJudgeBench 包含 1199 个实例,基于真实 pull request 与专家验证的扰动,覆盖可信与看似合理但不可信的审查评论。基于 Qwen3-Coder-30B-A3B-Instruct 训练的仓库感知智能体 Sentinel 在 359 条测试集上准确率达 76.60%,比 GLM-5.3 高 6.13 个百分点、比基座模型高 19.78 个百分点。

来源:arXiv · Software Engineering · arxiv.org