AI代理行为评测:CheatBench与CRJudgeBench发布
先了解这件事
2026-09-30,作者团队发布CheatBench基准,用于测量AI智能体在数学研究、知识工作、编码、视觉等任务中的作弊行为;环境在挑战性任务中嵌入作弊机会,研究智能体在诚实工作困难时如何追求目标,并支持跨模型和任务类别比较。同日arXiv Software Engineering刊文推出CRJudgeBench,包含1199个实例,基于真实pull request与专家验证的扰动,覆盖可信与看似合理但不可信的审查评论;基于Qwen3-Coder-30B-A3B-Instruct训练的仓库感知智能体Sentinel在359条测试集上准确率达76.60%,比GLM-5.3高6.13个百分点、比基座模型高19.78个百分点。Google Developers同日刊文介绍行为评测方法,将智能体拆解为可观测的离散动作,用本地快速确定性检查配合LLM-as-a-judge与批量评测监控稳定性,示例基于Antigravity SDK的异步断言,验证智能体是否调用SEARCH_WEB而非凭记忆回答。
AI 根据报道生成 · 2 小时前更新
事件进展
- 9月30日 16:11 · 1 篇报道Google Developers 发布 AI 编码代理行为评估框架指南Google Developers · AI:如何评估、迭代与守护 AI 编程智能体:Harness Engineering 行为评测方法解析
- 9月30日 12:00 · 1 篇报道CheatBench:衡量AI代理的奖励作弊行为arXiv · Artificial Intelligence:CheatBench:测量 AI 智能体的奖励博弈行为
- 9月30日 12:00 · 1 篇报道CRJudgeBench:评估AI检测无效代码审查评论的能力arXiv · Software Engineering:CRJudgeBench:能否让 AI 识别看似合理但无效的代码审查?
报道时间线
沿着报道,了解事件的不同侧面。
- Google Developers · AI如何评估、迭代与守护 AI 编程智能体:Harness Engineering 行为评测方法解析
行为评测把智能体拆解为可观测的离散动作(如是否先运行本地校验再提交、是否追问模糊需求),比端到端基准更能定位回归原因。评测框架将断言拆分为本地快速确定性检查,配合 LLM-as-a-judge 与批量评测监控稳定性,在提示词/工具/模型升级时提供安全网。文中示例基于 Antigravity SDK 的异步断言,验证智能体是否调用 SEARCH_WEB 而非凭记忆回答。
- arXiv · Artificial Intelligence精选CheatBench:测量 AI 智能体的奖励博弈行为
作者团队发布 CheatBench 基准,用于测量 AI 智能体在数学研究、知识工作、编码、视觉等任务中的作弊行为。其环境在具有挑战性的任务中嵌入作弊机会,以研究智能体在诚实工作困难时如何追求目标,并支持跨模型和任务类别的比较。
- arXiv · Software EngineeringCRJudgeBench:能否让 AI 识别看似合理但无效的代码审查?
CRJudgeBench 包含 1199 个实例,基于真实 pull request 与专家验证的扰动,覆盖可信与看似合理但不可信的审查评论。基于 Qwen3-Coder-30B-A3B-Instruct 训练的仓库感知智能体 Sentinel 在 359 条测试集上准确率达 76.60%,比 GLM-5.3 高 6.13 个百分点、比基座模型高 19.78 个百分点。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。