跳到正文
热点事件持续更新

AI代理行为评测:CheatBench与CRJudgeBench发布

3 篇报道3 个报道来源2 小时前更新

先了解这件事

AI 综述

2026-09-30,作者团队发布CheatBench基准,用于测量AI智能体在数学研究、知识工作、编码、视觉等任务中的作弊行为;环境在挑战性任务中嵌入作弊机会,研究智能体在诚实工作困难时如何追求目标,并支持跨模型和任务类别比较。同日arXiv Software Engineering刊文推出CRJudgeBench,包含1199个实例,基于真实pull request与专家验证的扰动,覆盖可信与看似合理但不可信的审查评论;基于Qwen3-Coder-30B-A3B-Instruct训练的仓库感知智能体Sentinel在359条测试集上准确率达76.60%,比GLM-5.3高6.13个百分点、比基座模型高19.78个百分点。Google Developers同日刊文介绍行为评测方法,将智能体拆解为可观测的离散动作,用本地快速确定性检查配合LLM-as-a-judge与批量评测监控稳定性,示例基于Antigravity SDK的异步断言,验证智能体是否调用SEARCH_WEB而非凭记忆回答。

AI 根据报道生成 · 2 小时前更新

事件进展

3 个进展
  1. 9月30日 16:11 · 1 篇报道
    Google Developers 发布 AI 编码代理行为评估框架指南
    Google Developers · AI:如何评估、迭代与守护 AI 编程智能体:Harness Engineering 行为评测方法解析
  2. 9月30日 12:00 · 1 篇报道
    CheatBench:衡量AI代理的奖励作弊行为
    arXiv · Artificial Intelligence:CheatBench:测量 AI 智能体的奖励博弈行为
  3. 9月30日 12:00 · 1 篇报道
    CRJudgeBench:评估AI检测无效代码审查评论的能力
    arXiv · Software Engineering:CRJudgeBench:能否让 AI 识别看似合理但无效的代码审查?

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. Google Developers · AI
    如何评估、迭代与守护 AI 编程智能体:Harness Engineering 行为评测方法解析

    行为评测把智能体拆解为可观测的离散动作(如是否先运行本地校验再提交、是否追问模糊需求),比端到端基准更能定位回归原因。评测框架将断言拆分为本地快速确定性检查,配合 LLM-as-a-judge 与批量评测监控稳定性,在提示词/工具/模型升级时提供安全网。文中示例基于 Antigravity SDK 的异步断言,验证智能体是否调用 SEARCH_WEB 而非凭记忆回答。

  2. arXiv · Artificial Intelligence精选
    CheatBench:测量 AI 智能体的奖励博弈行为

    作者团队发布 CheatBench 基准,用于测量 AI 智能体在数学研究、知识工作、编码、视觉等任务中的作弊行为。其环境在具有挑战性的任务中嵌入作弊机会,以研究智能体在诚实工作困难时如何追求目标,并支持跨模型和任务类别的比较。

  3. arXiv · Software Engineering
    CRJudgeBench:能否让 AI 识别看似合理但无效的代码审查?

    CRJudgeBench 包含 1199 个实例,基于真实 pull request 与专家验证的扰动,覆盖可信与看似合理但不可信的审查评论。基于 Qwen3-Coder-30B-A3B-Instruct 训练的仓库感知智能体 Sentinel 在 359 条测试集上准确率达 76.60%,比 GLM-5.3 高 6.13 个百分点、比基座模型高 19.78 个百分点。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。