arXiv · Machine Learning Theory· Xiaofei Yin, Tong Chu, Jiyuan Fu, Jun Lan, Shuheng Zhou, Huijia Zhu·· 16 小时前AI 评分25
SF-MOPD:慢快双模型多教师在线策略蒸馏保留通用能力
Slow-Fast Multi-Teacher On-Policy Distillation for Capability Preservation
AI 导读
研究者提出 Slow-Fast Multi-Teacher On-Policy Distillation(SF-MOPD),用当前学生模型作为快模型、以学生指数移动平均作为慢模型,缓解多教师在线策略蒸馏(MOPD)中的能力干扰。
来源:arXiv · Machine Learning Theory · arxiv.org