跳到正文
热点事件持续更新

策略蒸馏教会新技能而非新知识

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月8日,arXiv Computation and Language 发布一项研究,探讨在线策略蒸馏(OPD)对语言模型推理与知识获取的影响。研究通过可控合成框架,将事实知识与组合技能分离,在三个模型族的四个模型上开展实验。结果显示,reverse-KL OPD 能可靠迁移组合技能,却几乎不迁移事实知识;改用 forward KL 可恢复事实迁移,学生 rollout 则专门提升多步推理执行。近期事实 QA 与竞赛数学实验也呈现相同不对称:OPD 带来推理提升,但未扩展参数知识。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · Computation and Language
    在线策略蒸馏教会新技能,却教不会新知识

    在线策略蒸馏(OPD)能强化语言模型推理,但学生模型是否获得新事实知识一直不明。研究用可控合成框架分离事实知识与组合技能,在三个模型族的四个模型上发现:reverse-KL OPD 能可靠迁移组合技能,却几乎不迁移事实知识。改用 forward KL 可恢复事实迁移,学生 rollout 则专门提升多步推理执行;近期事实 QA 与竞赛数学实验也显示同样不对称,OPD 带来推理提升但未扩展参数知识。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。