arXiv · Artificial Intelligence· Chengyang Shi, Xianglin Ji, Jintao Huang, Jicheng Wang, Yifeng He, Jiachen Liu·· 17 小时前AI 评分55
OEB:从智能体执行记录测量认知过程
Open-Endedness Bench: Measuring Epistemic Process from Agent Records
AI 导读
论文提出 OEB(Open-Endedness Bench),一种不依赖参考答案或结果分数、只读智能体执行记录的评测方法。OEB 将记录编译为认知事件图,按证据、实验、修正和无奖励黑客四项能力轴评分;在 12 个任务、119 次运行中,智能体声称的改进只有 16-29% 经日志验证为真实。
来源:arXiv · Artificial Intelligence · arxiv.org