热点事件持续更新
AREX-2:基于长 horizon 反思任务提升自改进 Agent 能力
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
AREX-2 基于 Qwen3.8-27B,通过机器学习与算法编程任务合成长程改进轨迹进行训练,在 MLE-bench Lite(81.8)和 Frontier-CS(70.7)上取得强结果,并迁移至 BrowseComp(84.0)、HLE(52.6)、GAIA(92.2)和 DeepSearchQA(93.8),且随轮次预算增加持续提升。
AI 根据报道生成 · 1 小时前更新
最新进展10月1日 12:00
AREX-2 在多个基准上公布分数,并展示随预算增加持续提升。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- arXiv · Artificial IntelligenceAREX-2:通过长程反思任务推进自改进智能体
AREX-2 基于 Qwen3.8-27B,利用机器学习和算法编程任务合成长程改进轨迹进行训练,在 MLE-bench Lite(81.8)和 Frontier-CS(70.7)上取得强结果,并迁移至 BrowseComp(84.0)、HLE(52.6)、GAIA(92.2)和 DeepSearchQA(93.8),且随轮次预算增加持续提升。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。