跳到正文
原文
arXiv · Computation and Language· Yekun Chai, Qiwei Peng, Haoyi Xiong·· 16 小时前AI 评分45

XiangqiBench:用中国象棋闭环评估 LLM 智能体

Finding the Move Is Not Winning the Game: XiangqiBench for Closed-Loop Evaluation of LLM Agents

AI 导读

XiangqiBench 是一个可执行基准,从 119 个有引擎或仅搜索验证的强制杀局出发,要求 LLM 智能体对引擎防守方完成将杀,并用交互式 REPL 区分真实走子、状态查询与前向模拟。

来源:arXiv · Computation and Language · arxiv.org