跳到正文
原文
arXiv · Artificial Intelligence· Chengyang Shi, Xianglin Ji, Jintao Huang, Jicheng Wang, Yifeng He, Jiachen Liu·· 17 小时前AI 评分55

OEB:从智能体执行记录测量认知过程

Open-Endedness Bench: Measuring Epistemic Process from Agent Records

AI 导读

论文提出 OEB(Open-Endedness Bench),一种不依赖参考答案或结果分数、只读智能体执行记录的评测方法。OEB 将记录编译为认知事件图,按证据、实验、修正和无奖励黑客四项能力轴评分;在 12 个任务、119 次运行中,智能体声称的改进只有 16-29% 经日志验证为真实。

来源:arXiv · Artificial Intelligence · arxiv.org