arXiv · Software Engineering· Haobin Li, Liang Jiang, Zhenyu Huang, Mouxing Yang, Xi Peng·· 3 小时前AI 评分36
HERO:分层强化学习实现高效编程智能体
Doing More with Less Tokens: Hierarchical Reinforcement Learning for Efficient Coding Agents
AI 导读
HERO 通过分层强化学习在 SWE-bench Verified 和 SWE-bench Multilingual 上实现分辨率率与 token 效率的平衡。模型在轨迹和轮次两个层级鼓励高效推理模式,利用成功解析可用更少 token、未产生活动与轮次熵相关的观察。实验表明 HERO 相比现有编程智能体和强化学习方法在 token 开销上更优。
来源:arXiv · Software Engineering · arxiv.org