跳到正文
原文
arXiv · Software Engineering· Hantian Ding, Chloe Bi, Jiacheng Zhu, John Yang, Matt Deitke, Pengcheng Yin, Zijian Wang, Rui Hou·· 3 小时前AI 评分44

E2E-SWE:评测大语言模型从零构建完整可用代码库的能力

E2E-SWE: Benchmarking LLMs on Building Working Codebases from Scratch

AI 导读

E2E-SWE 是一个评测大语言模型端到端构建完整可用代码库的基准,包含 186 个跨 11 种编程语言的全仓库生成任务。评测覆盖 13 个前沿模型,pass@1 介于 11.7% 到 67.7% 之间,模型间差异显著且仍有进步空间。智能体轨迹分析显示,任务前期需要大量规划和系统级推理。

来源:arXiv · Software Engineering · arxiv.org