跳到正文
原文
arXiv · Computer Vision· Yanan Wang, Tingsong Li, Kaixun Jiang, Chongyang Zhong, Chenwei Xoe, Zhaohe Liao·· 6 小时前AI 评分36

Beyond Binary Preferences: Graded Preference Optimization for Limb-Motion Captioning

Beyond Binary Preferences: Graded Preference Optimization for Limb-Motion Captioning

AI 导读

提出 Graded Margin Direct Preference Optimization(GM-DPO),对肢体动作错误分配更强的偏好边距和训练权重,在 Qwen3-8B 上相对 DPO 将加权幻觉率降低 21.3%,GPA 提升 2.02-3.40 分。

来源:arXiv · Computer Vision · arxiv.org