arXiv · Machine Learning Theory· Yi Wang, Rui Qian, Yu Li, Haoyang Yao, Wenjie Wang·· 3 小时前AI 评分32
LoopOPD:面向 LoopLM 的跨循环在线策略蒸馏框架
Recurrent Self-Improvement: Dynamic Cross-Loop On-Policy Distillation for Looped Language Models
AI 导读
研究者提出 LoopOPD 与动态版 D-LoopOPD,让 LoopLM 以自身冻结的终端循环策略作为计算特权教师,在学生生成的 rollout 上提供密集监督,无需外部教师或特权信息。
来源:arXiv · Machine Learning Theory · arxiv.org