跳到正文
原文
arXiv · Machine Learning Theory· Jonas Schweisthal, Yuxin Wang, Athiya Deviyani, Stefan Feuerriegel, Dennis Frauen·· 4 小时前AI 评分27

推理时对齐的 Best-of-N 策略高效评估方法

Efficient Best-of-N policy evaluation for inference-time alignment

AI 导读

论文提出一种仅需样本的框架,用于在无法获得响应似然的条件下评估与选择 Best-of-N(BoN)策略。研究利用 BoN 的顺序统计结构,将密度比表示为可由样本估计的 score-rank 概率,并构建可跨候选预算复用共享辅助样本池的双重稳健估计器 BoN-DR。在合成实验与 GSM8K 上,该框架能准确估计 BoN 策略价值并选出有效采样预算。

来源:arXiv · Machine Learning Theory · arxiv.org