Beyond Rule-Based Mutation Testing: Test-Aware Mutant Generation Using Large Language Models
提出 test-aware mutant generation 方法,让 LLM 在接收问题描述、标准解法和基础测试后生成通过基础测试的非平凡变异体。
提出 test-aware mutant generation 方法,让 LLM 在接收问题描述、标准解法和基础测试后生成通过基础测试的非平凡变异体。
RIKEN AIP 共有 18 篇论文被 EMNLP 2026 录用,其中 Main Conference 9 篇、Findings 7 篇、其他赛道 2 篇。论文覆盖探针鲁棒性、注意力机制、嵌入正则化、Mamba 位置记忆、Agent 技能攻击、MoE 压缩等多个方向。
GPT-6.1 Sol 现已在 Amazon Bedrock 上正式可用,据 OpenAI 称其以约 GPT-6 Astra 五分之一的成本在 DeepSWE v1.1 上达到相近推理水平。它同时在多步工作流、复杂文档分析和透明度评估上优于前代 GPT-6 Sol,并可通过 Codex、ChatGPT Work 及 Bedrock API 应用于编码、文档处理和跨系统协调场景。
OpenAI 在撤回 GPT-6.1 Astra 后发布 GPT-6.1 Sol,宣称在编码、计算机使用、专业与科学任务上接近 Astra。DeepSWE 上 Sol 匹配 Astra 且成本约五分之一,OSWorld 2.0 离线集接近 Astra,Terminal-Bench Science 0.1 得分翻倍但 Astra 仍领先。
推荐理由:原文给出具体测试分数与单价对比,读者可据此评估 Sol 在成本与能力之间是否值得替代 Astra。
OpenAI 发布 GPT-6.1 Sol,主打接近 Astra 的智能水平,面向编码、计算机使用和专业工作,API 输入输出 token 价格为 Astra 标准版的五分之一。
summary_zh: OpenAI DevDay 2026 发布 20 余项更新,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全及开发者工具。
OpenAI 在 DevDay 2026 开发者大会更新 Codex 与 API,新增可复用云端开发环境、仓库安全扫描、Agents API 的 Computer Use,以及基于 GPT-6 Luna 的 Decisions API。
OpenAI 在 Dev Day 上为 Codex 推出可跨设备访问的可复用云开发环境,CLI 支持语音控制和 /agents 视图,ChatGPT 桌面端新增代码审查体验,同时发布 Codex Security Cloud 安全工具和 Decisions API 等更新。
OpenAI 在 DevDay 发布 GPT-6.1 Sol,称其在智能编码、电脑使用和专业工作上接近 GPT-6 Astra,输入输出 token 价格为标准价的五分之一。
推荐理由:新模型以五分之一定价接近旗舰性能,为开发者提供高性价比的编码与自动化工作流选项。
Space Bunny Alpha 在 OpenRouter 和 OpenCode 上线后冲上日调用量第一,响应快、长上下文稳定、编码和 Agent 表现好。测试中它能把涂鸦草图转为可交互网站,并实现喷墨占地小游戏和液氧甲烷发动机剖视展品;与 Opus 5.5、GPT-6 Astra 等相比,细节和复杂运动仍有差距。推测与 MiniMax M3.1 同源,目前免费调用。
Anthropic 的 Thariq Shihipar 在播客中深入讲解 Claude Code 的当前用法与未来方向,涵盖 Ask User Question、Artifacts、Projects、Claude Tag、Claude Mods 等功能,并讨论提示词工程、模型路由、可变软件、代理安全与 Pacing the Frontier 等议题。
xAI 的 Grok 4.7 已可在 Amazon Bedrock 使用,上下文窗口为 500K token,推理强度分 low、medium、high、xhigh 四档。
Anthropic 发布 Claude Sonnet 5.5,称其运行速度快 30% 以上、多数任务成本最多降低 30%,定价与 Sonnet 5 相同。该模型现用于 claude.ai 免费层,Simon Willison 实测它在部分编码任务上接近 Opus 5.5。Anthropic 同时表示 Haiku 5.5 将在未来几周内推出。
Claude Sonnet 5.5 今日已在 Amazon Bedrock 上线,也可在北美的 Claude Platform on AWS 使用,适合范围明确的编码与知识工作,多数任务成本更低、速度更快。
Anthropic 发布 Claude Sonnet 5.5,基准接近 Opus 5.5,输出快逾 30%,单任务成本最多低 30%。
推荐理由:Sonnet 5.5多项基准接近Opus 5.5且单任务成本最多低三成,编码成绩相对前代抬升尤其明显。
Anthropic 发布中端模型 Sonnet 5.5,称其比约三个月前的 Sonnet 5 快 30%、费用低得多,token 消耗速率明显更慢,可用于编程和制作办公文档等日常任务。
Meta 推出新业务单元 Meta Enterprise Platform,向企业出售 AI 工具。首批包括 Muse agent、Meta Business Agent、Muse API 和 Muse Code,由前 MongoDB CEO Chirantan Desai 负责并直接向 Mark Zuckerberg 汇报。
Atlassian 联合创始人兼 CEO Mike Cannon-Brookes 在 The Verge 的 Decoder 访谈中反驳 SaaSpocalypse,认为前沿模型即使再增强,也难以独自运营充满合规、人员与创造性的复杂企业。
OpenAI 正在征集用 Codex 做出出色成果的建造者、动手实践者、研究者和创作者的真实故事。想加入 Codex Originals 项目下一章的人,可在下方介绍自己的故事和项目。
Simon Willison 用闭幕演讲笔记按时间串起 2026 年迄今的 LLM 变化,指出 Claude Opus 4.5 和 GPT-5.1 配上各自编码智能体后已足以日常使用。
Proaction 借助 Codex、GPT-Live-1 和 GPT-6 Astra,把销售额提升了 60%,并节省 75+ 小时。依托这套模型组合,该公司得以更快地构建、运营和销售现代车队管理服务。
AWS 博客教程演示将 OpenCode 与 Amazon Bedrock 上的开源权重模型(Kimi K3、GPT-OSS 120B、Nemotron 3 Super 120B)配对,实现终端本地交互、推理在 AWS 账户内完成、无基础设施管理和按量付费。
GPT-6 Astra 能生成更结构化、上下文感知更强的法律文档,让律师更专注于策略制定。
Simon Willison 与 Jesse Vincent 将于 10 月 14 日(周三)在旧金山举办一场面向 coding agents 构建者的 Agentic Engineering 同好交流会(Birds of a Feather)。
summary_zh: Airbnb 扩大 GPT-6 Astra 与 OpenAI 前沿模型的访问权限,帮助工程团队解决 bug、设计系统并加速交付。 Airbnb 扩大 GPT-6 Astra 与 OpenAI 前沿模型的访问权限,帮助工程团队解决 bug、设计系统并加速交付。
Together AI 发布从闭源迁移到开源模型(OSM)的策略指南,采用托管服务可将迁移时间从数月/年缩短至数周。指南建议通过定义用例、筛选相关基准(如 FrontierCode、LMArena、τ-bench 等)锁定候选模型,并基于每任务成本、token 消耗和延迟进行对比,最终用真实流量回放做准确性与性能评估。
GPT‑6 Astra 提升 Devin 的软件测试与验证能力,旨在帮助工程师减少代码审查量、加快交付。
GitHub Copilot App 内置 diff、terminal 和 browser 面板,让用户在同一界面内审查 AI 代码更改、运行命令并预览功能,无需切换编辑器、终端和浏览器。
César de la Fuente 的实验室使用 Codex 和 ChatGPT 在现存与灭绝基因组中搜索抗菌候选分子,以应对耐药感染。
summary_zh: MIT 研究员使用 GPT-5.6 Sol 配合 Codex 自主运行量子计算实验、分析结果并校准量子比特。该方案展示了 LLM 在量子实验自动化中的实际应用路径。
AI 编程工具大幅增加代码量,但 96% 的开发者不信任 AI 输出,审查压力随之上升。Sonar 调查显示 AI 贡献了 42% 的新增代码,61% 的开发者认为 AI 代码不可靠,审查工作量增加 38%。
1Password 工程师使用 Codex 快速构建新功能与内部工具,在保持严格安全策略的同时达到生产就绪状态,工程效率提升 21%。
GitHub Copilot app 支持同时运行多个智能体,每个会话相互独立,并可各自基于独立的 Git worktree 并行执行、保留自身上下文。用户在 sessions view 中可通过卡片查看各会话标题与任务进度,自由切换且无需重新说明上下文。以 tailspin-toys
Legora 使用 GPT-6 Astra 在数分钟内审阅了 41 份文档,找出全部 4 个植入错误,并在财务审核工作流中性能提升近 40%。
Playco 基于 GPT-6 Astra 从一个灰色框基础构建了三款主题游戏原型,手动修复数量比上一模型减少 50%。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者延续 3.7 Flash 的速度与定价(每百万输入 token 0.75 美元、每百万输出 token 3.75 美元),在软件工程、智能体任务和多步推理上明显提升。
推荐理由:3.8 Flash 在相同价格下把提升集中在长周期编码与智能体任务,读者可据此判断是否替换现有生产模型。
哈佛研究显示,生成式 AI 采纳后 6 个季度内初级员工就业下降约 9%,而资深员工就业继续增长。斯坦福 ADP 薪资数据分析发现,AI 暴露度高的职业中最年轻劳动者在 2022 年后失去优势。两种解释指向同一机制:AI 吸收了新手 formative work 或远程工作切断了 mentorship,导致专家培养通道断裂。
Balaji Ingole在B2B电商公司Amla领导AI驱动的数字转型项目,开发AI智能体帮助制造商在电商平台自动完成商品上架。传统商品设置需手动处理数千产品、耗时2至3个月,AI工具可大幅缩短这一流程。目前文章未披露具体模型版本、参数规模或benchmark分数。
Google DeepMind 发布 Gemini 3.7 Flash,定位为编码与智能体工作负载的最智能基础模型,在 FrontierCode 1.1 Main(43.6% vs 34.4%)。
Epoch 和 METR 发布 MirrorCode 基准,测试 AI 在仅通过 CLI 访问的情况下重新实现软件程序的能力。Opus 4.7 在 14 小时、$251 推理成本内完成了一个需人类 2-17 周的任务。25 个目标程序中 17 个至少有一次满分运行,8 个从未达到 100%。
推荐理由:MirrorCode 显示 AI 已能自主重新实现大型软件项目,读者可借此评估当前模型在长程编程任务上的真实能力边界。