arXiv · Computation and Language· Yixuan Tang, Yi Yang·· 3 小时前AI 评分50
在线策略蒸馏教会新技能,却教不会新知识
On-Policy Distillation Teaches New Skills but Not New Knowledge
AI 导读
在线策略蒸馏(OPD)能强化语言模型推理,但学生模型是否获得新事实知识一直不明。研究用可控合成框架分离事实知识与组合技能,在三个模型族的四个模型上发现:reverse-KL OPD 能可靠迁移组合技能,却几乎不迁移事实知识。改用 forward KL 可恢复事实迁移,学生 rollout 则专门提升多步推理执行;近期事实 QA 与竞赛数学实验也显示同样不对称,OPD 带来推理提升但未扩展参数知识。
来源:arXiv · Computation and Language · arxiv.org