跳到正文
原文
arXiv · Machine Learning Theory· Doseok Jang, Jon Ander Campos, Youran Qi·· 1 天前AI 评分31

词典序多目标在线策略蒸馏(LMOPD)

Lexicographic Multi-Objective On-Policy Distillation

AI 导读

论文提出词典序多目标在线策略蒸馏 LMOPD,用多教师方式按显式优先级整合奖励专用策略,在每个学生 rollout 中选择首个检测到缺陷的专家,并投影其 log-policy 修正以移除与更高优先级专家相悖的分量。

来源:arXiv · Machine Learning Theory · arxiv.org