跳到正文
原文
arXiv · Computation and Language· Hui Dai, Lina Piao, Nick Merrill, Nadja Flechner, Ezra Karger, Haifeng Xu·· 6 小时前AI 评分40

CruxBench:信息发现基准

CruxBench: A Benchmark of Information Discovery

AI 导读

CruxBench 评估大语言模型的信息发现能力,通过 Value of Information(VOI)对模型生成的子问题打分。基准包含 293 个目标预测问题,VOI 与模型能力独立度量高度相关(r=0.90)。前沿模型仅略优于随机基线,信息发现仍具挑战。

来源:arXiv · Computation and Language · arxiv.org