跳到正文
原文
arXiv · Artificial Intelligence· Xiang Chen, Futao Su, Kong Wang, Jiayi Chen, TanLin Li·· 16 小时前AI 评分33

SR-OPD:按成功参照分配教师 token 的在策略蒸馏

Spend Teacher Tokens Where They Matter: Success-Referenced On-Policy Distillation

AI 导读

研究者提出 Success-Referenced On-Policy Distillation(SR-OPD),在在策略蒸馏中按提示与 rollout 是否有成功样本选择教师监督,优先处理与成功参照隐藏状态轨迹持续分歧的失败 rollout。

来源:arXiv · Artificial Intelligence · arxiv.org