跳到正文
原文
arXiv · Machine Learning Theory· Sadegh Khorasani, Petrus Mikkola, Matthias Grossglauser·· 3 小时前AI 评分35

直接偏好优化中的不确定性归一化间隔方法(UNM-DPO)

Uncertainty-Normalized Margins for Direct Preference Optimization

AI 导读

summary_zh: UNM-DPO 引入依赖强度的间隔与可学习的提示词尺度,基于异方差 Bradley-Terry 模型提出优势仅(AO)与全残差(WR)两种训练目标。

来源:arXiv · Machine Learning Theory · arxiv.org