跳到正文
原文
arXiv · Artificial Intelligence· Yuxiang Zhang, Ding Cao, Shuting Cui, Lei Wang, Weijieying Ren, Tianxiang Zhao·· 16 小时前AI 评分35

Seg-OPD:用分段式在线蒸馏学习推理修订

Learning to Revise Reasoning with Segment-wise On-Policy Distillation

AI 导读

研究者提出分段式在线蒸馏方法 Seg-OPD,用于学习推理修订。该方法基于不确定性指标选取学生模型的推理片段,获取教师模型对应的重写版本,训练学生偏好教师重写片段,同时保留 token 级密集监督。在数学推理与竞赛编程任务上,Seg-OPD 的修订成功率高于基线,推理准确率平均相对提升 5.22%,代码已开源。

来源:arXiv · Artificial Intelligence · arxiv.org