arXiv · Machine Learning· Zhiwei Zhang, Huayu Deng, Fei Zhao, Jiayan Fu, Bin Liang, Kam-Fai Wong, Mu Chuan·· 5 小时前AI 评分49
ROSS:通过选择性监督从自生成回放中重新学习
ROSS: Relearning from Self-Generated Rollouts through Selective Supervision
AI 导读
ROSS 在强化学习与在线蒸馏生成的历史回放中保留完整轨迹,仅对选定的模型生成续接部分施加损失。在 Qwen3.6-35B-A3B 上,六项基准 MOPD 平均分从 58.40% 提升至 62.20%,SWE-bench Verified 从 64.20% 提升至 68.40%,无需额外策略回放即可通过离线 SFT 复用行为经验。
来源:arXiv · Machine Learning · arxiv.org