Skip to content
arXiv · Software Engineering· Nishant Balepur, Kiran Tomlinson, Tobias Schnabel·· 4 hr agoAI score44

CABRA:代码理解为何成为 Coding Agents 的瓶颈

Code Understanding is a Bottleneck for Coding Agents

AI brief

研究提出 CABRA 评测框架,通过调用图变换生成任务,并沿函数遍历、搜索、运行时解析、指令遵循四轴扩展难度。在 6,840 个任务上测试八个 LLM 与六个 coding agents,发现 LLM 准确率随任务规模下降,而 agents 借助 grep 等工具保持近乎完美;SWE-bench Verified 上工具调用次数比编辑代码行数更能预测准确率。

Source: arXiv · Software Engineering · arxiv.org