跳到正文
原文
arXiv · Machine Learning· Xuan Liu, Jingbin Qian, Haosheng Chen·· 3 小时前精选AI 评分60

从 Pass@K 与 Pass@1 的差距中学习

Learning from the Gap Between Pass@K and Pass@1

AI 导读

论文提出 GapFT,通过单次解码结果筛选训练样本,聚焦策略单样本失败但 K 样本内可恢复的问题。在 LogiQA 2.0 和 ReClor 上,基于 Llama-3.1-8B 的 Pass@1 相对提升 14.4 和 13.9 点,单次解码达到源模型 verifier-selected Pass@4 水平,且仅用全量验证池三分之一的匹配预算。

推荐理由

通过区分首句成功与K样本内恢复的失败,针对性填补模型单次推理的能力缺口。

来源:arXiv · Machine Learning · arxiv.org