arXiv · Computation and Language· Di Huang, Hao Li, Yixin Chen, Fuhai Li·· 8 hr agoSelectedAI score62
点向前向KL自蒸馏的裁剪为何会反转修正:On-policy Self-Distillation的失败动力学
When Clipping Reverses Correction: Failure Dynamics of Pointwise Forward-KL On-Policy Self-Distillation
AI brief
论文指出在数学推理的OPSD中,点向前向KL裁剪虽被用于稳定训练,却会导致学生模型产生更多持续到回复末尾的重复。理论分析证明裁剪目标可能无法将学生拉向教师,反而使裁剪与未裁剪词元概率偏离教师;实验显示在重复内部,裁剪学生更不愿离开重复而更倾向延续,未裁剪运行则更接近教师。
Why it matters
原文通过实验与理论分析揭示前向KL裁剪可能加剧重复而非稳定训练,读者可据此重新审视OPSD中裁剪策略的适用边界。
Source: arXiv · Computation and Language · arxiv.org