GPT-6.1 Sol 在 Amazon Bedrock 上正式可用,为智能体工作流带来接近 Astra 的推理能力
GPT-6.1 Sol 现已在 Amazon Bedrock 上正式可用,据 OpenAI 称其以约 GPT-6 Astra 五分之一的成本在 DeepSWE v1.1 上达到相近推理水平。它同时在多步工作流、复杂文档分析和透明度评估上优于前代 GPT-6 Sol,并可通过 Codex、ChatGPT Work 及 Bedrock API 应用于编码、文档处理和跨系统协调场景。
GPT-6.1 Sol 现已在 Amazon Bedrock 上正式可用,据 OpenAI 称其以约 GPT-6 Astra 五分之一的成本在 DeepSWE v1.1 上达到相近推理水平。它同时在多步工作流、复杂文档分析和透明度评估上优于前代 GPT-6 Sol,并可通过 Codex、ChatGPT Work 及 Bedrock API 应用于编码、文档处理和跨系统协调场景。
OpenAI 在撤回 GPT-6.1 Astra 后发布 GPT-6.1 Sol,宣称在编码、计算机使用、专业与科学任务上接近 Astra。DeepSWE 上 Sol 匹配 Astra 且成本约五分之一,OSWorld 2.0 离线集接近 Astra,Terminal-Bench Science 0.1 得分翻倍但 Astra 仍领先。
推荐理由:原文给出具体测试分数与单价对比,读者可据此评估 Sol 在成本与能力之间是否值得替代 Astra。
IQuest-Q1是IQuest Lab发布的decoder-only Transformer稀疏MoE模型,总参数320B、激活15B,能凭一句Prompt生成可在竖屏手机运行的HTML游戏,并从RL训练日志中定位推理服务额外插入空格导致的Reward曲线异常。
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,两家在同档位展开价格战。
推荐理由:文中列出各模型每百万 token 的输入输出价格,便于对比这轮降价后同档位模型的报价差距。
OpenAI 发布 GPT-6 Sol 与 Luna 两款模型,在能力与成本之间提供不同平衡,将前沿智能带入日常工作中。
Salesforce 在 Dreamforce 发布首个 CRM 推理模型 Koa,由 NVIDIA Nemotron 3 Super 后训练而来,可用 NVIDIA NeMo RL 等工具微调,训练语料覆盖 14+ 行业。
Sebastian Raschka 分享了对 GPT-6 Astra 的使用印象,指出其在 3D 渲染、动画、ARC-AGI-3(99.9%)等任务上表现突出,并探讨了循环变压器架构与隐藏推理链的传闻。
GPT-6 Astra 是 OpenAI 面向商业场景的最强模型,具备高级推理、计算机使用能力,以及更强的写作与设计判断力。
OpenAI 数学团队于 9 月 8 日宣布,10,000 个自主 AI 智能体在其指导下运行一款未公开的高级模型,在三维 Navier-Stokes 方程中找到了一个“奇点”,从而解决 Clay 数学研究所 2000 年提出的六个千年奖难题之一。剩余五个千年奖问题仍未解决。该模型未向公众开放。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者延续 3.7 Flash 的速度与定价(每百万输入 token 0.75 美元、每百万输出 token 3.75 美元),在软件工程、智能体任务和多步推理上明显提升。
推荐理由:3.8 Flash 在相同价格下把提升集中在长周期编码与智能体任务,读者可据此判断是否替换现有生产模型。
IBM Granite 4.2 推理模型家族(3B/8B/30B)采用分阶段强化学习流水线构建,支持思考/非思考切换与低思考预算模式。8B 与 30B 经过智能体 RL 训练,可在真实沙盒环境中进行代码编辑、终端操作与网页搜索,训练基于 NeMo-RL 与 NeMo-Gym,最终以 Apache 2.0 许可证开源。
推荐理由:详细展示了从可验证奖励到智能体环境交互的分阶段强化学习流水线,为构建具备工具调用能力的推理模型提供了可复现的训练框架。
Google DeepMind 发布 Gemini 3.7 Flash,定位为编码与智能体工作负载的最智能基础模型,在 FrontierCode 1.1 Main(43.6% vs 34.4%)。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。
推荐理由:新模型在 token 效率和成本上较 3.5 Flash 显著提升,3.5 Flash-Lite 以更高吞吐和更低延迟面向规模化 agentic 工作流。
Thinking Machines Lab 发布 Inkling,Together AI 在发布当日将其上线至 Serverless 推理平台。Inkling 是 975B 总参数、40B 活跃参数的混合专家模型,支持 1M 上下文、接受文本、图像和音频输入并输出文本,提供可控推理强度设定,并在科学推理、数学、代码、预测等任务上进行了后训练。
推荐理由:原文给出 Inkling 的参数规模、上下文长度和可控推理设定,开发者可据此评估它在推理深度与 token 开销之间的平衡。
Inkling 由 Thinking Machines 发布,是一个原生接收图像、文本和音频输入的大规模多模态开源模型,总参数约 1T、活跃参数 41B,支持 1M 上下文窗口。
推荐理由:Inkling 是原生接收图音文三模态的大规模开源模型,提供 BF16 与 NVFP4 双版本及 day-0 支持的推理引擎,读者可据此评估其在多模态推理基准中的相对位置。
Mistral 发布 Leanstral 1.5,这是一个 Apache-2.0 许可的 Lean 4 形式验证模型,119B 总参数、6B 激活参数。它在 miniF2F 上达到 100%,解出 PutnamBench 587/672 题,FATE-H 为 87%、FATE-X 为 34%,权重已在 Hugging Face 开源并提供免费 API。
summary_zh: BAIR 2026 届博士毕业生涵盖机器人与具身智能、大语言模型与推理、计算机视觉、生成式建模、AI 安全、人机交互、AI for Science 等方向。
Google DeepMind 发布 Gemini 3.5 Flash,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上表现领先,输出速度比其他前沿模型快 4 倍。
推荐理由:原文给出 Flash 在多个基准上的具体分数与速度倍数,读者可据此对比其与上一代 Pro 的能力变化。
伯克利研究团队综述了自适应并行推理(APR)范式,提出模型可自主决定何时分解任务、生成多少并行线程以及如何协调。APR 通过特殊控制标记在推理时动态分配串行与并行计算,相比固定并行和多数投票等方法能减少冗余并避免上下文膨胀。文中对比了 Multiverse 等修改推理引擎与 ThreadWeaver 等保持引擎不变的系统设计,并讨论了基于关键路径的并行效率奖励和当前开放问题。
推荐理由:原文梳理了自适应并行推理的范式与推理系统实现差异,读者可据此理解不同并行策略在延迟和准确率上的权衡。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 Effective 2B、Effective 4B、26B MoE 与 31B Dense 四种规格,31B 在 Arena AI 文本榜位列全球第 3,26B 位列第 6。模型原生支持多模态、函数调用、128K–256K 上下文与 140+ 语言,并采用 Apache 2.0 许可证。
推荐理由:原文给出 Gemma 4 四种规格与 Arena 排名,读者可据此评估本地部署与边缘场景的可行性。
Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码能力,Apache 2.0 开源许可。模型采用 MoE 架构,119B 总参数含 6B 激活参数,支持 256k 上下文,延迟优化下完成时间减少 40%、吞吐优化下每秒请求数提升 3 倍。来源:https://mistral.ai/news/mistral-small-4/
推荐理由:Mistral Small 4 将推理、多模态与编码能力整合进单一开源模型,用户无需在多个专用模型间切换即可处理复杂任务与文档分析。
SPEX 与 ProxySPEX 是用于在大规模下识别大语言模型关键交互作用的算法框架,利用稀疏性和低阶性将搜索问题转化为稀疏恢复问题。ProxySPEX 利用层次结构特性,以约 1/10 的消融次数达到与 SPEX 相当的性能。
Sebastian Raschka 分析了 DeepSeek V3.2 的架构与训练更新,包括引入 DeepSeek Sparse Attention(DSA)提升长上下文效率、在 RLVR 基础上加入自验证与自精炼以改进数学推理,以及 GRPO 的多项稳定性改进。V3.2 保留与 V3 相同的 MoE+MLA 架构,并在推理任务上接近 GPT-5 与 Gemini 3.0 Pro 水平。
summary_zh: 文章梳理了近期出现的大语言模型非主流架构替代方案,包括文本扩散模型与线性注意力混合架构等。
OpenAI 发布 gpt-oss-120b 与 gpt-oss-20b 两款开源权重模型,是自 GPT-2 以来首次开放大权重模型。模型采用 MoE、SwiGLU、GQA、滑动窗口注意力和 RMSNorm 等现代设计,并支持 MXFP4 量化以在单卡运行。两款模型均为推理模型,支持低/中/高推理强度调节,并在多个基准上接近 OpenAI 自有闭源模型。
Mistral AI 发布首个推理模型 Magistral,分开源的 Magistral Small(24B)与企业版 Magistral Medium;Magistral Medium 在 AIME2024 得分 73.6%,多数投票 @64 达 90%,Small 分别为 70.7% 与 83.3%。
推荐理由:Mistral 首次推出推理模型 Magistral,分开源与企业两个版本,读者可据此对比其推理能力与部署选择。