On-policy self-distillation clipping failure dynamics
先了解这件事
2026-10-01 arXiv 同时发表三篇关于 On-policy Self-Distillation(OPSD)的一手研究,共同聚焦数学推理场景下的训练稳定性与教师信号问题。第一篇指出,点向前向KL裁剪本用于稳定训练,却导致学生模型产生更多持续到回复末尾的重复;理论分析证明裁剪目标可能无法将学生拉向教师,反而使裁剪与未裁剪词元概率偏离教师,实验显示裁剪学生在重复内部更不愿离开、未裁剪运行更接近教师。第二篇诊断 0.6B–8B 参数模型,发现教师信号受推理模式对齐与完整教师前缀影响,OPSD 仅在狭窄兼容 regime 中有效,否则出现长度膨胀、稳定退化或行为崩溃,且教师信号不稳定、无法预测下游性能。第三篇对比 On-policy 与 Off-policy 蒸馏的理论差异,发现前向 KL 散度产生加权算术混合,后向 KL 散度产生归一化加权几何聚合;后向 KL 在无信息反馈下更能保留自信专家的偏好,但对低概率教师更敏感。
AI 根据报道生成 · 1 小时前更新
事件进展
- 10月1日 12:00 · 2 篇报道On-policy self-distillation clipping failure dynamicsarXiv · Computation and Language:点向前向KL自蒸馏的裁剪为何会反转修正:On-policy Self-Distillation的失败动力学
- 10月1日 12:00 · 1 篇报道Understanding Off- vs On-Policy DistillationarXiv · Statistics Machine Learning:理解 Off-Policy 与 On-Policy 蒸馏:两种不同训练目标的对比分析
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv · Statistics Machine Learning理解 Off-Policy 与 On-Policy 蒸馏:两种不同训练目标的对比分析
该研究对比了 On-policy 蒸馏(OPD)与 Off-policy 蒸馏的理论差异,发现前向 KL 散度产生加权算术混合,后向 KL 散度产生归一化加权几何聚合。研究在表格设定中建立了对数遗憾界并扩展到函数近似,揭示了 OPD 优势与脆弱性的机制:后向 KL 在无信息反馈下更能保留自信专家的偏好,但对低概率教师更敏感。
- arXiv · Computation and Language精选点向前向KL自蒸馏的裁剪为何会反转修正:On-policy Self-Distillation的失败动力学
论文指出在数学推理的OPSD中,点向前向KL裁剪虽被用于稳定训练,却会导致学生模型产生更多持续到回复末尾的重复。理论分析证明裁剪目标可能无法将学生拉向教师,反而使裁剪与未裁剪词元概率偏离教师;实验显示在重复内部,裁剪学生更不愿离开重复而更倾向延续,未裁剪运行则更接近教师。
- arXiv · Computation and Language精选诊断推理语言模型的 On-Policy Self-Distillation
论文诊断了数学推理场景下的 On-Policy Self-Distillation(OPSD),覆盖 0.6B–8B 参数模型。实验与 token 级分析表明,教师信号受推理模式对齐与完整教师前缀影响,OPSD 仅在狭窄兼容 regime 中有效,否则出现长度膨胀、稳定退化或行为崩溃,且教师信号不稳定、无法预测下游性能。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。