跳到正文
原文
arXiv · Computation and Language· Chenglei Shen, Haoyang Yao, Weijie Yu, Song Jin, Xiao Zhang, Jun Xu·· 16 小时前AI 评分29

Learning from Repaired Reasoning:根因引导的在策略蒸馏

Learning from Repaired Reasoning: Root-Cause-Guided On-Policy Distillation

AI 导读

论文提出根因引导的在策略蒸馏方法 RC-OPD,改进现有在策略自蒸馏 OPSD 仅以参考解作事后监督、忽视学生自身推理错误的问题。RC-OPD 对每次失败尝试定位最早实质性错误、生成局部修正,并以修正后的中间结果作为有效前缀的锚点,在固定修复预算内迭代执行诊断—修复—延续。论文在多个数据集与模型规模上开展实验与消融分析,称该方法缓解推理错配与蒸馏陷阱,带来显著性能提升。

来源:arXiv · Computation and Language · arxiv.org