Beyond Rule-Based Mutation Testing: Test-Aware Mutant Generation Using Large Language Models
提出 test-aware mutant generation 方法,让 LLM 在接收问题描述、标准解法和基础测试后生成通过基础测试的非平凡变异体。
提出 test-aware mutant generation 方法,让 LLM 在接收问题描述、标准解法和基础测试后生成通过基础测试的非平凡变异体。
RIKEN AIP 共有 18 篇论文被 EMNLP 2026 录用,其中 Main Conference 9 篇、Findings 7 篇、其他赛道 2 篇。论文覆盖探针鲁棒性、注意力机制、嵌入正则化、Mamba 位置记忆、Agent 技能攻击、MoE 压缩等多个方向。
GPT-6.1 Sol 现已在 Amazon Bedrock 上正式可用,据 OpenAI 称其以约 GPT-6 Astra 五分之一的成本在 DeepSWE v1.1 上达到相近推理水平。它同时在多步工作流、复杂文档分析和透明度评估上优于前代 GPT-6 Sol,并可通过 Codex、ChatGPT Work 及 Bedrock API 应用于编码、文档处理和跨系统协调场景。
OpenAI 发布 GPT-6.1 Sol,主打接近 Astra 的智能水平,面向编码、计算机使用和专业工作,API 输入输出 token 价格为 Astra 标准版的五分之一。
summary_zh: OpenAI DevDay 2026 发布 20 余项更新,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全及开发者工具。
xAI 的 Grok 4.7 已可在 Amazon Bedrock 使用,上下文窗口为 500K token,推理强度分 low、medium、high、xhigh 四档。
Claude Sonnet 5.5 今日已在 Amazon Bedrock 上线,也可在北美的 Claude Platform on AWS 使用,适合范围明确的编码与知识工作,多数任务成本更低、速度更快。
OpenAI 正在征集用 Codex 做出出色成果的建造者、动手实践者、研究者和创作者的真实故事。想加入 Codex Originals 项目下一章的人,可在下方介绍自己的故事和项目。
Proaction 借助 Codex、GPT-Live-1 和 GPT-6 Astra,把销售额提升了 60%,并节省 75+ 小时。依托这套模型组合,该公司得以更快地构建、运营和销售现代车队管理服务。
AWS 博客教程演示将 OpenCode 与 Amazon Bedrock 上的开源权重模型(Kimi K3、GPT-OSS 120B、Nemotron 3 Super 120B)配对,实现终端本地交互、推理在 AWS 账户内完成、无基础设施管理和按量付费。
GPT-6 Astra 能生成更结构化、上下文感知更强的法律文档,让律师更专注于策略制定。
summary_zh: Airbnb 扩大 GPT-6 Astra 与 OpenAI 前沿模型的访问权限,帮助工程团队解决 bug、设计系统并加速交付。 Airbnb 扩大 GPT-6 Astra 与 OpenAI 前沿模型的访问权限,帮助工程团队解决 bug、设计系统并加速交付。
summary_zh: 教育研究者发现学生能将课程作业完全外包给AI(如Codex),导致认知参与度下降。2025年美国高校教师调查发现90%认为生成式AI会削弱学生批判性思维,全球约20%大学生表示离开AI更难独立解题。
Together AI 发布从闭源迁移到开源模型(OSM)的策略指南,采用托管服务可将迁移时间从数月/年缩短至数周。指南建议通过定义用例、筛选相关基准(如 FrontierCode、LMArena、τ-bench 等)锁定候选模型,并基于每任务成本、token 消耗和延迟进行对比,最终用真实流量回放做准确性与性能评估。
GPT‑6 Astra 提升 Devin 的软件测试与验证能力,旨在帮助工程师减少代码审查量、加快交付。
GitHub Copilot App 内置 diff、terminal 和 browser 面板,让用户在同一界面内审查 AI 代码更改、运行命令并预览功能,无需切换编辑器、终端和浏览器。
César de la Fuente 的实验室使用 Codex 和 ChatGPT 在现存与灭绝基因组中搜索抗菌候选分子,以应对耐药感染。
summary_zh: MIT 研究员使用 GPT-5.6 Sol 配合 Codex 自主运行量子计算实验、分析结果并校准量子比特。该方案展示了 LLM 在量子实验自动化中的实际应用路径。
1Password 工程师使用 Codex 快速构建新功能与内部工具,在保持严格安全策略的同时达到生产就绪状态,工程效率提升 21%。
GitHub Copilot app 支持同时运行多个智能体,每个会话相互独立,并可各自基于独立的 Git worktree 并行执行、保留自身上下文。用户在 sessions view 中可通过卡片查看各会话标题与任务进度,自由切换且无需重新说明上下文。以 tailspin-toys
Legora 使用 GPT-6 Astra 在数分钟内审阅了 41 份文档,找出全部 4 个植入错误,并在财务审核工作流中性能提升近 40%。
Playco 基于 GPT-6 Astra 从一个灰色框基础构建了三款主题游戏原型,手动修复数量比上一模型减少 50%。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者延续 3.7 Flash 的速度与定价(每百万输入 token 0.75 美元、每百万输出 token 3.75 美元),在软件工程、智能体任务和多步推理上明显提升。
推荐理由:3.8 Flash 在相同价格下把提升集中在长周期编码与智能体任务,读者可据此判断是否替换现有生产模型。
Google DeepMind 发布 Gemini 3.7 Flash,定位为编码与智能体工作负载的最智能基础模型,在 FrontierCode 1.1 Main(43.6% vs 34.4%)。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。
推荐理由:新模型在 token 效率和成本上较 3.5 Flash 显著提升,3.5 Flash-Lite 以更高吞吐和更低延迟面向规模化 agentic 工作流。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 Gemini 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
summary_zh: BAIR 2026 届博士毕业生涵盖机器人与具身智能、大语言模型与推理、计算机视觉、生成式建模、AI 安全、人机交互、AI for Science 等方向。
Mistral 为 Connectors 新增多项管理与安全能力:按 workspace 或组织分配连接器访问权限、带 connector scope 的 API key、单个连接器绑定多账号,三项均已 GA。
Mistral 将 Le Chat 升级为统一的 AI 智能体 Vibe,同一订阅同时覆盖工作与编码,用户原有的对话、设置和方案自动保留。
推荐理由:Le Chat 升级为 Vibe 后把工作流与编码并入同一智能体和同一订阅,读者可了解其功能边界与定价分层。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密开源权重模型,具备 256k 上下文窗口,在 SWE-Bench Verified 上得分 77.6%。
推荐理由:128B 开源权重模型把编码智能体搬到云端,读者可据此判断自托管与异步并行任务的取舍。
Mistral 在 Studio 发布 Connectors,使内置与自定义 MCP 可通过 API/SDK 用于所有模型和 Agent 调用,并支持直接工具调用与人工审批流程。开发者可将企业集成封装为可复用实体集中注册,减少重复搭建与认证壁垒。
推荐理由:Studio 新增 Connectors 与直接工具调用,开发者可将企业集成封装为可复用实体并在 LeChat 与 AI Studio 间共享,减少重复搭建与认证壁垒。
Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码能力,Apache 2.0 开源许可。模型采用 MoE 架构,119B 总参数含 6B 激活参数,支持 256k 上下文,延迟优化下完成时间减少 40%、吞吐优化下每秒请求数提升 3 倍。来源:https://mistral.ai/news/mistral-small-4/
推荐理由:Mistral Small 4 将推理、多模态与编码能力整合进单一开源模型,用户无需在多个专用模型间切换即可处理复杂任务与文档分析。
Mistral 发布 Leanstral,首个面向 Lean 4 的开源代码智能体,在 FLTEval 基准上以 6B 参数超越多个更大开源模型。它通过 Mistral Vibe 集成、支持 MCP,提供免费 API 和 Apache 2.0 权重;pass@2 得分 26.3 仅需 $36,而 Sonnet 4.6 需 $549。
基于 Mistral 开源编码助手 Vibe 构建了一个自主代理,能自动读取 Rails 源文件并生成或改进 RSpec 测试,在 CI/CD 流水线中无人干预运行。通过 AGENTS.md 上下文工程和按文件类型分类的 SKILLS 文件,质量分数从 0.68 提升到 0.74。该代理并行处理多个文件,并自动管理 factories 和 fixtures 等共享上下文,避免测试遗漏。
Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型族驱动,新增自定义子智能体、多选项澄清、斜杠命令技能和统一智能体模式。
推荐理由:原文列出子智能体、斜杠命令技能等可配置能力与付费方式,读者可据此判断终端编码智能体的团队落地成本。
Mistral AI 发布 Devstral 2 编码模型系列,包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,并推出配套开源 CLI Mistral Vibe。
推荐理由:官方给出参数规模、基准得分与人类评估胜率,可对照开源与闭源编码模型的能力与成本差距。
Mistral 发布 Codestral 25.08,并推出包含 Codestral Embed、Devstral 与 Mistral Code 插件的企业级编程栈,支持云、VPC 与本地部署。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium 和 Devstral Small 1.1 代码智能体模型。Devstral Small 1.1 以 Apache 2.0 开源,SWE-Bench Verified 达 53.6%,为开源无测试时缩放模型新标杆。
推荐理由:Devstral Small 1.1 在 SWE-Bench Verified 上达 53.6% 成为开源代码智能体新标杆,Devstral Medium 以四分之一价格超越 Gemini 2.5 Pro 和 GPT-4.1。
Mistral 发布企业级 AI 编程助手 Mistral Code,基于开源项目 Continue 构建,今日开放支持 JetBrains IDE 和 VSCode 的私有 beta,正式版即将推出。
Devstral 是 Mistral AI 与 All Hands AI 合作开发的开源智能体编程模型,在 SWE-Bench Verified 上得分 46.8%,领先开源 SoTA 超过 6 个百分点。
推荐理由:Devstral以46.8%的SWE-Bench Verified成绩超越多数闭源模型,且可本地部署,读者可据此评估开源方案在真实软件工程任务中的可行性。