arXiv · Software Engineering· Igor Slinko, Yaroslav Golubev, Sergey Titov·· 4 hr agoAI score44
Coding-Agent 评测应匹配用户的任务流
Coding-Agent Benchmarks Should Match Their Users' Task Flows
AI brief
研究收集了 4,782 个 JetBrains IDE 中真实软件工程师的智能体会话(Production Sessions),发现长会话的任务类型跨度更广且会在会话中频繁切换,不同公开语料的 Task Flows 差异明显,不存在普适的交互分布。
Source: arXiv · Software Engineering · arxiv.org