arXiv · Computation and Language· Tianle Wang, Jiayu Liu, Ruizhi Zhao, Ning Miao·· 4 hr agoAI score38
SAPD:步对齐的特权知识蒸馏方法
SAPD: Step-Aligned Privileged Distillation
AI brief
SAPD 是一种无需 rollout 的自蒸馏方法,把固定演示转化为步对齐的分布式监督,为每个推理步骤匹配针对性的特权指导。在数学推理基准上平均优于监督微调和标签平滑,与在线强化学习和自蒸馏相当,训练循环速度约提升 2x,并基本保持域外编码性能。代码已开源。
Source: arXiv · Computation and Language · arxiv.org