arXiv · Artificial Intelligence· Xiang Chen, Futao Su, Kong Wang, Jiayi Chen, TanLin Li·· 16 小时前AI 评分33
SR-OPD:按成功参照分配教师 token 的在策略蒸馏
Spend Teacher Tokens Where They Matter: Success-Referenced On-Policy Distillation
AI 导读
研究者提出 Success-Referenced On-Policy Distillation(SR-OPD),在在策略蒸馏中按提示与 rollout 是否有成功样本选择教师监督,优先处理与成功参照隐藏状态轨迹持续分歧的失败 rollout。
来源:arXiv · Artificial Intelligence · arxiv.org