跳到正文
热点事件持续更新

On-policy self-distillation clipping failure dynamics

3 篇报道2 个报道来源2 小时前更新

先了解这件事

AI 综述

2026-10-01 arXiv 同时发表三篇关于 On-policy Self-Distillation(OPSD)的一手研究,共同聚焦数学推理场景下的训练稳定性与教师信号问题。第一篇指出,点向前向KL裁剪本用于稳定训练,却导致学生模型产生更多持续到回复末尾的重复;理论分析证明裁剪目标可能无法将学生拉向教师,反而使裁剪与未裁剪词元概率偏离教师,实验显示裁剪学生在重复内部更不愿离开、未裁剪运行更接近教师。第二篇诊断 0.6B–8B 参数模型,发现教师信号受推理模式对齐与完整教师前缀影响,OPSD 仅在狭窄兼容 regime 中有效,否则出现长度膨胀、稳定退化或行为崩溃,且教师信号不稳定、无法预测下游性能。第三篇对比 On-policy 与 Off-policy 蒸馏的理论差异,发现前向 KL 散度产生加权算术混合,后向 KL 散度产生归一化加权几何聚合;后向 KL 在无信息反馈下更能保留自信专家的偏好,但对低概率教师更敏感。

AI 根据报道生成 · 1 小时前更新

事件进展

2 个进展
  1. 10月1日 12:00 · 2 篇报道
    On-policy self-distillation clipping failure dynamics
    arXiv · Computation and Language:点向前向KL自蒸馏的裁剪为何会反转修正:On-policy Self-Distillation的失败动力学
  2. 10月1日 12:00 · 1 篇报道
    Understanding Off- vs On-Policy Distillation
    arXiv · Statistics Machine Learning:理解 Off-Policy 与 On-Policy 蒸馏:两种不同训练目标的对比分析

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv · Statistics Machine Learning
    理解 Off-Policy 与 On-Policy 蒸馏:两种不同训练目标的对比分析

    该研究对比了 On-policy 蒸馏(OPD)与 Off-policy 蒸馏的理论差异,发现前向 KL 散度产生加权算术混合,后向 KL 散度产生归一化加权几何聚合。研究在表格设定中建立了对数遗憾界并扩展到函数近似,揭示了 OPD 优势与脆弱性的机制:后向 KL 在无信息反馈下更能保留自信专家的偏好,但对低概率教师更敏感。

  2. arXiv · Computation and Language精选
    点向前向KL自蒸馏的裁剪为何会反转修正:On-policy Self-Distillation的失败动力学

    论文指出在数学推理的OPSD中,点向前向KL裁剪虽被用于稳定训练,却会导致学生模型产生更多持续到回复末尾的重复。理论分析证明裁剪目标可能无法将学生拉向教师,反而使裁剪与未裁剪词元概率偏离教师;实验显示在重复内部,裁剪学生更不愿离开重复而更倾向延续,未裁剪运行则更接近教师。

  3. arXiv · Computation and Language精选
    诊断推理语言模型的 On-Policy Self-Distillation

    论文诊断了数学推理场景下的 On-Policy Self-Distillation(OPSD),覆盖 0.6B–8B 参数模型。实验与 token 级分析表明,教师信号受推理模式对齐与完整教师前缀影响,OPSD 仅在狭窄兼容 regime 中有效,否则出现长度膨胀、稳定退化或行为崩溃,且教师信号不稳定、无法预测下游性能。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。