跳到正文
原文
arXiv · Software Engineering· Igor Slinko, Yaroslav Golubev, Sergey Titov·· 4 小时前AI 评分44

Coding-Agent 评测应匹配用户的任务流

Coding-Agent Benchmarks Should Match Their Users' Task Flows

AI 导读

研究收集了 4,782 个 JetBrains IDE 中真实软件工程师的智能体会话(Production Sessions),发现长会话的任务类型跨度更广且会在会话中频繁切换,不同公开语料的 Task Flows 差异明显,不存在普适的交互分布。

来源:arXiv · Software Engineering · arxiv.org