跳到正文
热点事件持续更新

HERO:分层强化学习提升编码代理Token效率

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026-10-01,arXiv 发表软件工程领域论文,介绍 HERO 方法。该方法通过分层强化学习在 SWE-bench Verified 与 SWE-bench Multilingual 上平衡分辨率率与 token 效率。HERO 在轨迹与轮次两个层级鼓励高效推理模式,利用成功解析减少 token 消耗,并避免与轮次熵相关的无效活动。实验显示 HERO 相比现有编程智能体与强化学习方法在 token 开销上更优。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv · Software Engineering
    HERO:分层强化学习实现高效编程智能体

    HERO 通过分层强化学习在 SWE-bench Verified 和 SWE-bench Multilingual 上实现分辨率率与 token 效率的平衡。模型在轨迹和轮次两个层级鼓励高效推理模式,利用成功解析可用更少 token、未产生活动与轮次熵相关的观察。实验表明 HERO 相比现有编程智能体和强化学习方法在 token 开销上更优。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。