Skip to content
Hot eventLive

策略蒸馏教会新技能而非新知识

1 reports1 sources4 hr ago updated

Get the story

AI overview

2026年10月8日,arXiv Computation and Language 发布一项研究,探讨在线策略蒸馏(OPD)对语言模型推理与知识获取的影响。研究通过可控合成框架,将事实知识与组合技能分离,在三个模型族的四个模型上开展实验。结果显示,reverse-KL OPD 能可靠迁移组合技能,却几乎不迁移事实知识;改用 forward KL 可恢复事实迁移,学生 rollout 则专门提升多步推理执行。近期事实 QA 与竞赛数学实验也呈现相同不对称:OPD 带来推理提升,但未扩展参数知识。

Generated from reports · updated 3 hr ago

Timeline

Follow the coverage from different angles.

Oct 8, 2026
  1. arXiv · Computation and Language
    在线策略蒸馏教会新技能,却教不会新知识

    在线策略蒸馏(OPD)能强化语言模型推理,但学生模型是否获得新事实知识一直不明。研究用可控合成框架分离事实知识与组合技能,在三个模型族的四个模型上发现:reverse-KL OPD 能可靠迁移组合技能,却几乎不迁移事实知识。改用 forward KL 可恢复事实迁移,学生 rollout 则专门提升多步推理执行;近期事实 QA 与竞赛数学实验也显示同样不对称,OPD 带来推理提升但未扩展参数知识。

Heat trend

Current heat 9·Comparable peak 10(Oct 8)·Comparable change over 24 hours –

02.557.510Oct8Oct8Oct8Oct8

The trend compares only the same participants observed continuously; its range may be smaller than the current heat count. Move or click on the chart to inspect hourly heat; use the left and right arrow keys to switch.