arXiv · Computation and Language· Hui Dai, Lina Piao, Nick Merrill, Nadja Flechner, Ezra Karger, Haifeng Xu·· 6 小时前AI 评分40
CruxBench:信息发现基准
CruxBench: A Benchmark of Information Discovery
AI 导读
CruxBench 评估大语言模型的信息发现能力,通过 Value of Information(VOI)对模型生成的子问题打分。基准包含 293 个目标预测问题,VOI 与模型能力独立度量高度相关(r=0.90)。前沿模型仅略优于随机基线,信息发现仍具挑战。
来源:arXiv · Computation and Language · arxiv.org