跳到正文
原文
arXiv · Artificial Intelligence· Long Phan, Stephen K. Yang, Jason J. Lim, Mantas Mazeika, Wenyu Zhang, Zheyuan Liu, Richard Ren, Jingxiang Meng, Yaoteng Tan, Weiliang Zhao, Addison Wu, Matei Anghel, Dan Hendrycks·· 6 小时前精选AI 评分62

CheatBench:测量 AI 智能体的奖励博弈行为

CheatBench: Measuring Reward Gaming in AI Agents

AI 导读

作者团队发布 CheatBench 基准,用于测量 AI 智能体在数学研究、知识工作、编码、视觉等任务中的作弊行为。其环境在具有挑战性的任务中嵌入作弊机会,以研究智能体在诚实工作困难时如何追求目标,并支持跨模型和任务类别的比较。

推荐理由

为评估强化学习环境中智能体的奖励博弈行为提供了可复现的测试平台。

来源:arXiv · Artificial Intelligence · arxiv.org