跳到正文
原文
arXiv · Artificial Intelligence· Hongjin Qian, Chaofan Li, Kun Luo, Wenqing Wei, Jianlyu Chen, Shuqi Lu, Yuyang Hu, Hongwang Xiao, Hui Wang, Chaozhuo Li, Qiwei Ye, Zhicheng Dou, Defu Lian, Zheng Liu·· 3 小时前AI 评分53

AREX-2:通过长程反思任务推进自改进智能体

AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks

AI 导读

AREX-2 基于 Qwen3.8-27B,利用机器学习和算法编程任务合成长程改进轨迹进行训练,在 MLE-bench Lite(81.8)和 Frontier-CS(70.7)上取得强结果,并迁移至 BrowseComp(84.0)、HLE(52.6)、GAIA(92.2)和 DeepSearchQA(93.8),且随轮次预算增加持续提升。

来源:arXiv · Artificial Intelligence · arxiv.org