Latest selected
21–40 of 61- arXiv · Software EngineeringSelectedAI score7575
研究者对 Kimi K2.7 Code(1T 参数,32B 激活)进行单 epoch GSPO RL 后训练,仅用 1700 个任务,即在 SWE-Bench Pro、DeepSWE、Terminal-Bench 2.1/3/4 和 SWE-Marathon 六个外部基准上提升 pass@1,且对训练后发布的三个数据集仍显著(p=0.004)。
Why it matters: 用 RL 在 1700 个专家构建的编码任务上后训练 Kimi K2.7 Code,六个外部基准均显著提升,且对训练后发布的数据集仍然有效。
- arXiv · Software EngineeringSelectedAI score6262
论文提出 CONTRA,一种训练免费的方法,通过广度问题发现结合语义与执行验证来筛选澄清问题。实验在 ClarifyCodeBench 上显示,CONTRA 在四种编码 agent 上达到最高 F1,比最优基线 macro-average F1 高 13.88 个百分点,且澄清召回率与 F1 均高于 Claude Code 和 OpenHands。
Why it matters: 提出训练免费的澄清问题发现与验证方法,可在编码 agent 实际开发中减少因需求模糊导致的返工成本。
- arXiv · Software EngineeringSelectedAI score6262
论文研究弱评审能否可靠判断强编码代理的补丁是否解决问题,基于411条执行标注轨迹和101个受控案例。在154条GPT-5.4轨迹上,结构化但未校验的证据同时提升缺陷捕获与误拒率;官方执行证据作为上限诊断后,6位评审中5位在122条留存轨迹上同时改善两项指标,2位全对。
Why it matters: 研究指出结构化证据能提升弱评审对强编码代理的缺陷捕获率,但误拒和缺乏官方测试仍是主要瓶颈。
- arXiv · Software EngineeringSelectedAI score6767
论文提出 FORALL-LEAN-AGENT,一个前端无关的框架,用于形式数学和软件验证中的可审计推理,结合隔离工作区、Lean 工具与独立证明检查。在 VeriSoftBench 100 任务子集上,GPT-5.6 Sol 集成后基准规则成功数从 93 提升到 100,成本从 $69 降至 $62;PutnamBench 评估以平均每个问题 $4.72 接受全部 672 个问题。
Why it matters: 框架把验证证据与评审决定绑定到同一候选工件,使可接受性可追溯,为形式化证明的审计提供可迁移方法。
- arXiv · Computers and SocietySelectedAI score6767
SWE-chat 是首个大规模真实编程智能体会话数据集,包含近18000个会话、22.9万条用户提示和200万次工具调用。数据显示41%的会话为智能体主导编写,59%的智能体代码最终被提交,且智能体代码引入的安全漏洞多于人类代码;用户在50%的交互轮次中会纠正或拒绝智能体输出。
Why it matters: 基于近18000个真实会话数据,揭示智能体在自然开发环境中的实际效率与失败模式。
- arXiv · Artificial IntelligenceSelectedAI score7979
论文评估了 66 种配置:4 个可配置 harness(OpenHands、DeepSeek Harness、PI、openJiuwen)与 5 个模型在 TUA-Bench、ALE-CLI、Terminal-Bench 4 上的表现,另含 Codex-GPT 与 Claude Code-Claude 原生配对。
Why it matters: 同一模型在不同 harness 下排名可逆转,读者可据此判断选型不能只看模型本身。
- Apple Machine Learning ResearchSelectedAI score6868
Apple 与 EPFL 研究发现,在等时预算和相同前沿 LLM backbone 下,开源先进 harness 并不优于单会话极简编码智能体基线,大规模消融实验表明多层 machinery 在编码智能体场景下冗余,当前 MLE 基准上精心设计的 harness 投入回报率低。
Why it matters: 在等时和同 backbone 条件下,复杂 harness 并未超越极简编码智能体,提示当前 MLE 基准上模型本体才是性能主因。
- arXiv · Software EngineeringSelectedAI score6464
论文预注册假设后,用 50 个真实后端任务对比五款前沿模型在无规范与带 267 字规范框架两种条件下的输出。规范框架使缺陷数均值下降 0.16–0.70/任务,所有 Holm 校正符号检验显著,Bootstrap 置信区间不包含零;框架臂在 100 次对比中赢 95 次,且未使任一模型在任何领域更差。
Why it matters: 给团队一个可复现的实证:267 字规范框架在五款前沿模型上稳定降低缺陷,且不损害任何模型。
- arXiv · Software EngineeringSelectedAI score6262
Zero2Repo 是一个新基准,要求智能体根据产品需求文档和接口契约,从空白工作区交付完整仓库。任务由语言无关管线从真实开源项目生成,并以执行验证代替 LLM 裁判。当前版本覆盖 Python、TypeScript、Go 和 C++,最强智能体在 11 个任务中仅解决 10 个,且多数失败可归因于规范中的单一遗漏或低频规则。
Why it matters: 给出一个可从空白工作区构建完整仓库的基准,读者可借此评估编码智能体在真实工程任务上的实际能力边界。
- arXiv · Computation and LanguageSelectedAI score6666
论文提出诊断框架,系统评估终端智能体在 TerminalBench2.1 上的自验证行为,发现验证几乎总会触发,但错误检出率仅 61.43%、修复率仅 49.36%,主要瓶颈在检测与修复而非启动验证。
Why it matters: 诊断了终端智能体自验证的漏检与修复率,并给出蒸馏方法提升修复效果。
- arXiv · Computation and LanguageSelectedAI score6262
论文提出 TomasuLLM 运行时,在保持任务正确性的前提下按预测顺序提前执行 Agent 工具调用,并在验证后按轨迹顺序提交。在 SWE-bench Verified、Terminal-Bench 2.0 和 SWE-Marathon 上分别提速 1.31x、1.35x 和 1.27x,4010 条审计记录零误接受。https://arxiv.org/abs/2609.38201
Why it matters: 为长时工具延迟提供了乱序执行思路,读者可借此评估它对现有 Agent 工作流的潜在加速空间。
- arXiv · Artificial IntelligenceSelectedAI score6767
该研究提出让同一冻结模型在同一版本 harness 上先作为求解器执行任务、再作为提议者直接编辑自身 harness 的递归自改进框架。进化批次覆盖五个不同领域基准,训练与验证任务严格分离,并在五个分布外基准上评估。
Why it matters: 同一模型在多任务分布上自我迭代 harness,在分布外基准上超越 Codex,为递归自我改进提供了一条可复现的路径。
- arXiv · Software EngineeringSelectedAI score6262
论文提出Counterfactual Rollout Replay(CRR),在训练时利用可fork的可执行环境获取步骤级回报对比:选择决策点、恢复状态、采样替代动作并沿策略前向分支,以真实轨迹终端回报与反事实回报之差替换优势函数,无需人工过程标注或学习过程奖励模型。
Why it matters: 用可fork环境获得步骤级回报对比,无需人工标注或学习过程奖励模型,为SWE智能体训练提供了一种低监督成本的新思路。
- arXiv · Software EngineeringSelectedAI score6060
CodeNib 首次在同一清单下编译词法、稠密和结构三种视图,并通过单一源地址契约与代价可见的运行时为 Agent 提供搜索、导航和有界上下文。
Why it matters: 论文通过多视图数据系统对编码Agent的上下文供给做了可量化比较,读者可据此评估不同上下文策略在真实仓库任务中的成本与成功率。
- arXiv · Software EngineeringSelectedAI score6262
arXiv 论文提出 CodeThread 框架,在四个前沿编码智能体和四个基准上对比智能体代码与人类代码的可维护性。结果显示,智能体在基于智能体代码继续开发时任务解决率下降最多 13.1%,传统软件工程可维护性指标难以解释这一差异;输入校验、错误处理、下游代码规模和任务难度等行为差异信号更明显。
Why it matters: 研究揭示智能体代码在可维护性上的短板,为评估编码智能体提供了超越单任务解决率的新视角。
- arXiv · Software EngineeringSelectedAI score6767
论文系统评估了仓库上下文文件(如 AGENTS.md)对编码 Agent 任务完成率的影响,发现提供上下文文件并未普遍提升成功率,反而平均增加 20% 以上推理成本,且该结论在多种 LLM、编码 Agent 以及 LLM 生成与开发者提交的上下文文件中均成立。
Why it matters: 研究对仓库级上下文文件的实际效果提出质疑,读者可据此重新评估为编码 Agent 补充 AGENTS.md 的投入产出。
- arXiv · Software EngineeringSelectedAI score6262
该研究基于 AIDev v4 的 71,677 个智能体 PR,筛选出 1,262 个性能修复,涉及 6 个智能体和 582 个仓库。57% 的关闭修复被合并,61% 的拒绝未给出理由;重新执行 23 个被拒和 30 个合并修复后,仅 6 个被拒主张成立。
Why it matters: 研究揭示智能体修复性能问题的合并率与仓库历史相关,但合并并不等于修复有效。
- arXiv · Software EngineeringSelectedAI score6767
arXiv论文研究LLM智能体能否自主优化科学软件,覆盖t-SNE、ssGSEA和图计数三个问题;人类定义范围与正确性标准后,智能体自主工作数小时,经维护者审核验证。优化后实现全部更快,最高比现有最快工具快两个数量级,改进涵盖底层代码优化、数学重构和图计数全新算法。
Why it matters: 研究显示LLM智能体在可验证问题上能自主完成传统需人工数日的优化,读者可据此评估自身工作流中哪些优化环节可被委托。
- arXiv · Software EngineeringSelectedAI score6262
arXiv 论文以 ChatGPT-3.5 发布作为自然冲击,分析 2020–2025 年 Stack Overflow 两百万个问题,发现简单问题锐减、困难问题增加,数据丰富主题占比下降,数据稀缺主题上升,且简单问题的衰退集中在数据丰富领域。该模式跨越多种编程语言,流行语言的偏移更显著。
Why it matters: 研究揭示生成式 AI 释放后 Stack Overflow 知识生产的非均匀衰退路径,为理解 AI 对集体知识的影响提供实证依据。
- The Next Web · AISelectedAI score8282
OpenAI 在 DevDay 2026 发布 GPT-6.1 Sol,定价为 Astra 标准输入/输出 token 价格的五分之一,API 输入 $2/M、输出 $10/M,缓存输入 $0.10/M。
Why it matters: OpenAI以 Astra 五分之一的价格推出接近其能力的 Sol,为开发者提供高性价比的 Agent 编码与自动化工作流选择。