跳到正文
原文
arXiv · Artificial Intelligence· Ziyang Xu, Haitian Zhong, Hao Zhou, Hao Qin, Chenhan Jin, Te Qi, Shengze Xu, Tieyong Zeng·· 6 小时前AI 评分36

更多程序还是更多重复?LLM Harness 中覆盖率与专业化的分离

More Programs or More Rolls? Separating Coverage from Specialization in LLM Harnesses

AI 导读

研究在 386 个 MATH-500 任务上比较了 8 个生成 harness 与基线,每个成员执行 3 次。相同程序产生 2.16 个百分点的重复平均 oracle 余量,生成程序虽呈现更多重复得分模式,但相对基线的损失在所有 3 次重复中持续存在于 100 个任务,稳定互补性在 3 次重复中仍未解决。

来源:arXiv · Artificial Intelligence · arxiv.org