跳到正文
热点事件持续更新

E2E-SWE基准测试LLM从零构建完整代码库能力

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026-10-01,arXiv发表E2E-SWE基准,评测大语言模型从零构建完整可用代码库的能力。该基准包含186个跨11种编程语言的全仓库生成任务,覆盖13个前沿模型,pass@1介于11.7%到67.7%之间,模型间差异显著且仍有进步空间。智能体轨迹分析显示,任务前期需要大量规划和系统级推理。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv · Software Engineering
    E2E-SWE:评测大语言模型从零构建完整可用代码库的能力

    E2E-SWE 是一个评测大语言模型端到端构建完整可用代码库的基准,包含 186 个跨 11 种编程语言的全仓库生成任务。评测覆盖 13 个前沿模型,pass@1 介于 11.7% 到 67.7% 之间,模型间差异显著且仍有进步空间。智能体轨迹分析显示,任务前期需要大量规划和系统级推理。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。