跳到正文
原文
arXiv · Computation and Language· Tianle Wang, Jiayu Liu, Ruizhi Zhao, Ning Miao·· 3 小时前AI 评分38

SAPD:步对齐的特权知识蒸馏方法

SAPD: Step-Aligned Privileged Distillation

AI 导读

SAPD 是一种无需 rollout 的自蒸馏方法,把固定演示转化为步对齐的分布式监督,为每个推理步骤匹配针对性的特权指导。在数学推理基准上平均优于监督微调和标签平滑,与在线强化学习和自蒸馏相当,训练循环速度约提升 2x,并基本保持域外编码性能。代码已开源。

来源:arXiv · Computation and Language · arxiv.org