arXiv · Computation and Language· Tianle Wang, Jiayu Liu, Ruizhi Zhao, Ning Miao·· 3 小时前AI 评分38
SAPD:步对齐的特权知识蒸馏方法
SAPD: Step-Aligned Privileged Distillation
AI 导读
SAPD 是一种无需 rollout 的自蒸馏方法,把固定演示转化为步对齐的分布式监督,为每个推理步骤匹配针对性的特权指导。在数学推理基准上平均优于监督微调和标签平滑,与在线强化学习和自蒸馏相当,训练循环速度约提升 2x,并基本保持域外编码性能。代码已开源。
来源:arXiv · Computation and Language · arxiv.org