跳到正文
热点事件持续更新

AREX-2:基于长 horizon 反思任务提升自改进 Agent 能力

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

AREX-2 基于 Qwen3.8-27B,通过机器学习与算法编程任务合成长程改进轨迹进行训练,在 MLE-bench Lite(81.8)和 Frontier-CS(70.7)上取得强结果,并迁移至 BrowseComp(84.0)、HLE(52.6)、GAIA(92.2)和 DeepSearchQA(93.8),且随轮次预算增加持续提升。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv · Artificial Intelligence
    AREX-2:通过长程反思任务推进自改进智能体

    AREX-2 基于 Qwen3.8-27B,利用机器学习和算法编程任务合成长程改进轨迹进行训练,在 MLE-bench Lite(81.8)和 Frontier-CS(70.7)上取得强结果,并迁移至 BrowseComp(84.0)、HLE(52.6)、GAIA(92.2)和 DeepSearchQA(93.8),且随轮次预算增加持续提升。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。