arXiv · Machine Learning Theory· Langlin Huang, Hao Liu, Mononito Goswami, Xinyu Li, Prithwith Jana, Nikos Kanakaris, Patrick Bl\"obaum, Purak Jain·· 3 小时前AI 评分38
On-Policy Distillation 中的 Off-Policy Teacher 问题与 SCOUT 框架
On the Off-Policy Teacher in On-Policy Distillation
AI 导读
On-policy distillation(OPD)中学生策略生成的轨迹对教师而言是 off-policy,教师在更长前缀上的延续性能会下降。研究提出 SCOUT(Student-Conditioned Updates of the Teacher),通过强化学习与可验证奖励周期性优化教师对学生前缀的适应能力。
来源:arXiv · Machine Learning Theory · arxiv.org