跳到正文
原文
arXiv · Machine Learning Theory· Xiaofei Yin, Tong Chu, Jiyuan Fu, Jun Lan, Shuheng Zhou, Huijia Zhu·· 16 小时前AI 评分25

SF-MOPD:慢快双模型多教师在线策略蒸馏保留通用能力

Slow-Fast Multi-Teacher On-Policy Distillation for Capability Preservation

AI 导读

研究者提出 Slow-Fast Multi-Teacher On-Policy Distillation(SF-MOPD),用当前学生模型作为快模型、以学生指数移动平均作为慢模型,缓解多教师在线策略蒸馏(MOPD)中的能力干扰。

来源:arXiv · Machine Learning Theory · arxiv.org