arXiv · Statistics Machine Learning· Qiwei Di, Xuheng Li, Kaixuan Ji, Chenggong Zhang, Heyang Zhao, Quanquan Gu·· 3 小时前AI 评分36
理解 Off-Policy 与 On-Policy 蒸馏:两种不同训练目标的对比分析
Understanding Off- vs On-Policy Distillation: A Tale of Distinct Training Objectives
AI 导读
该研究对比了 On-policy 蒸馏(OPD)与 Off-policy 蒸馏的理论差异,发现前向 KL 散度产生加权算术混合,后向 KL 散度产生归一化加权几何聚合。研究在表格设定中建立了对数遗憾界并扩展到函数近似,揭示了 OPD 优势与脆弱性的机制:后向 KL 在无信息反馈下更能保留自信专家的偏好,但对低概率教师更敏感。
来源:arXiv · Statistics Machine Learning · arxiv.org