arXiv · Machine Learning Theory· Younwoo Choi, Leo Feng, Vincent Liu, Haanvid Lee·· 3 小时前AI 评分32
LLM 的摊销离策略评估方法 PFN-OPE
Amortized Off-Policy Evaluation for LLMs
AI 导读
提出 PFN-OPE,一种先验数据拟合网络,用于在上下文赌博机任务分布上摊销离策略评估(OPE),以应对策略偏移与奖励偏移。它在由多个奖励函数评分的 LLM 响应池构建的任务上预训练一次,测试时单次前向传播即可由日志数据集与每个提示的一个目标响应输出估值,无需逐任务拟合。
来源:arXiv · Machine Learning Theory · arxiv.org