Skip to content

#编码

5 today
TodayOct 1Thu
  1. arXiv · Software Engineering64

    规范先行:LLM 生成代码在资金、时间、幂等与访问任务上的预注册五模型对比评估

    论文预注册假设后,用 50 个真实后端任务对比五款前沿模型在无规范与带 267 字规范框架两种条件下的输出。规范框架使缺陷数均值下降 0.16–0.70/任务,所有 Holm 校正符号检验显著,Bootstrap 置信区间不包含零;框架臂在 100 次对比中赢 95 次,且未使任一模型在任何领域更差。

    Why it matters: 给团队一个可复现的实证:267 字规范框架在五款前沿模型上稳定降低缺陷,且不损害任何模型。

  2. arXiv · Software Engineering62

    Zero2Repo:编码智能体能否从零构建仓库?

    Zero2Repo 是一个从零构建仓库的基准,智能体接收需求文档与接口契约并在空工作区交付完整仓库。任务由语言无关管线从真实开源项目生成,并以隐藏测试的执行通过与否作为唯一评判标准。当前版本覆盖 Python、TypeScript、Go 和 C++,最强智能体在 11 个任务中仅解决 10 个,且失败提交中 90-99% 的隐藏测试通过,67-100% 的失败可归因于规范中的单一遗漏或低频规则。

    Why it matters: 给出了从零构建仓库的基准与评测方法,读者可据此评估现有编码智能体在真实工程任务上的完成度与薄弱环节。

  3. arXiv · Computation and Language66

    终端智能体能信任自己的验证吗?诊断与改进自验证

    论文提出诊断框架,系统评估终端智能体在 TerminalBench2.1 上的自验证行为,发现验证几乎总会触发,但错误检出率仅 61.43%、修复率仅 49.36%,主要瓶颈在检测与修复而非启动验证。

    Why it matters: 诊断了终端智能体自验证的漏检与修复率,并给出蒸馏方法提升修复效果。

  4. arXiv · Computation and Language62

    TomasuLLM:面向 LLM Agent 的乱序推测执行运行时

    论文提出 TomasuLLM 运行时,在保持任务正确性的前提下按预测顺序提前执行 Agent 工具调用,并在验证后按轨迹顺序提交。在 SWE-bench Verified、Terminal-Bench 2.0 和 SWE-Marathon 上分别提速 1.31x、1.35x 和 1.27x,4010 条审计记录零误接受。https://arxiv.org/abs/2609.38201

    Why it matters: 为长时工具延迟提供了乱序执行思路,读者可借此评估它对现有 Agent 工作流的潜在加速空间。

  5. arXiv · Artificial Intelligence67

    Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer

    该研究提出让同一冻结模型在同一版本 harness 上先作为求解器执行任务、再作为提议者直接编辑自身 harness 的递归自改进框架。进化批次覆盖五个不同领域基准,训练与验证任务严格分离,并在五个分布外基准上评估。

    Why it matters: 同一模型在多任务分布上自我迭代 harness,在分布外基准上超越 Codex,为递归自我改进提供了一条可复现的路径。