跳到正文
原文
arXiv · Software Engineering· Sushant Mehta, Logan Ritchie, Edwin Chen·· 2 小时前精选AI 评分75

基于智能体编码任务的 RL 跨基准迁移研究

Cross-Benchmark Transfer from RL on Agentic Coding Tasks

AI 导读

研究者对 Kimi K2.7 Code(1T 参数,32B 激活)进行单 epoch GSPO RL 后训练,仅用 1700 个任务,即在 SWE-Bench Pro、DeepSWE、Terminal-Bench 2.1/3/4 和 SWE-Marathon 六个外部基准上提升 pass@1,且对训练后发布的三个数据集仍显著(p=0.004)。

推荐理由

用 RL 在 1700 个专家构建的编码任务上后训练 Kimi K2.7 Code,六个外部基准均显著提升,且对训练后发布的数据集仍然有效。

来源:arXiv · Software Engineering · arxiv.org