arXiv · Artificial Intelligence· Ruoming Jin, Xinyu Li, Hao Zhou, Jianfeng Zhu, Ruixin Guo, Feodor Dragan, Lei Xu, Haixun Wang, Yang Zhou·· 3 小时前AI 评分35
Gradient-Aligned Pair Selection for Personalized Preference Optimization
Gradient-Aligned Pair Selection for Personalized Preference Optimization
AI 导读
提出 GAP-DPO 算法,将个性化偏好学习形式化为几何对齐优化问题,通过梯度对齐的成对选择策略控制分布偏移。在个性化文本生成基准上,GAP-DPO 相比标准 DPO 变体持续提升风格保真度、偏好对齐与生成质量。
来源:arXiv · Artificial Intelligence · arxiv.org