跳到正文
原文
arXiv · Software Engineering· Hexuan Deng, Yue Wang, Wenyu Jiang, Cheng Yang, Haolin Yang, Zhaohua Zhang, Chenchen Zhao, Beiduo Chen, Muxi Chen, Sa Zhu, Geyuan Zhu, Jianhuan Zhuo, Qiuyong Xiao, Tianwen Jiang, Jihong Zhang, Xuebo Liu·· 3 小时前AI 评分45

SWE-Journey:通过长周期、多轮交互更真实地评测编程助手

SWE-Journey: Towards More Realistic Evaluation of Coding Assistants through Long-Horizon, Multi-Turn Interaction

AI 导读

研究者提出 SWE-Journey 基准,用弱到强合成流水线自动构建长周期编程任务,并从真实交互数据挖掘四类用户画像、构建用户模拟智能体以还原多轮代码辅助交互。评测显示,模型在软件架构师场景下平均通过超 75% 的功能测试,在非程序员场景下不足 25%。研究将差距归因于问对、找对、修对三项关键交互能力。

来源:arXiv · Software Engineering · arxiv.org