GPT-6.1 Sol 在 Amazon Bedrock 上正式可用,为智能体工作流带来接近 Astra 的推理能力
GPT-6.1 Sol 现已在 Amazon Bedrock 上正式可用,据 OpenAI 称其以约 GPT-6 Astra 五分之一的成本在 DeepSWE v1.1 上达到相近推理水平。它同时在多步工作流、复杂文档分析和透明度评估上优于前代 GPT-6 Sol,并可通过 Codex、ChatGPT Work 及 Bedrock API 应用于编码、文档处理和跨系统协调场景。
GPT-6.1 Sol 现已在 Amazon Bedrock 上正式可用,据 OpenAI 称其以约 GPT-6 Astra 五分之一的成本在 DeepSWE v1.1 上达到相近推理水平。它同时在多步工作流、复杂文档分析和透明度评估上优于前代 GPT-6 Sol,并可通过 Codex、ChatGPT Work 及 Bedrock API 应用于编码、文档处理和跨系统协调场景。
OpenAI 发布 GPT-6.1 Sol,主打接近 Astra 的智能水平,面向编码、计算机使用和专业工作,API 输入输出 token 价格为 Astra 标准版的五分之一。
NVIDIA发布开源表格预测基础模型Kumo Tabular,单次前向传播即可预测,无需训练或调优。在TabArena等四个基准上排名第一,28M至215M参数规模下准确-效率达前沿,比LimiX-2快17倍。模型基于Transformer仅在人工数据上预训练,以OpenMDW-1.1许可证商业可用。
推荐理由:表格预测长期依赖梯度提升树,Kumo Tabular以单次前向传播提供无需训练与调优的预测且在TabArena等基准排名第一。
xAI 的 Grok 4.7 已可在 Amazon Bedrock 使用,上下文窗口为 500K token,推理强度分 low、medium、high、xhigh 四档。
Claude Sonnet 5.5 今日已在 Amazon Bedrock 上线,也可在北美的 Claude Platform on AWS 使用,适合范围明确的编码与知识工作,多数任务成本更低、速度更快。
Hcompany 发布智能体模型 Holo4,提供 27B 稠密版与 35B-A3B MoE,并推出 Holotron4 Nano。
推荐理由:同一模型同时覆盖图形界面、代码和工具调用,便于对照它在更低成本下与闭源模型的长流程得分差距。
GPT-6 Sol 与 GPT-6 Luna 已在 Amazon Bedrock 正式可用,两款模型的 API 定价均显著低于 GPT-5.6 前代。GPT-6 Sol 面向每周重复出现的复杂编码与运维任务,OpenAI 内部事实性评测显示其事实性错误约为 GPT-5.6 Sol 的一半;GPT-6 Luna 面向高并发的信息提取、摘要、分类和聚焦问答,可逐请求调整推理强度。
推荐理由:原文对比了 GPT-6 Sol 与 Luna 在 Bedrock 上的定位和定价,给出按任务分层选型与提示词缓存的实践参考。
OpenAI 发布 GPT-6 Sol 与 Luna 两款模型,在能力与成本之间提供不同平衡,将前沿智能带入日常工作中。
Claude Opus 5.5 已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型。
推荐理由:原文对比 Opus 5 给出 token 效率与定价变化,并附 Bedrock 调用方式,便于判断迁移成本与接入路径。
NVIDIA 官方发布 Vera Rubin NVL72 在 MLPerf Inference v6.1 的预览结果,在 DeepSeek-R1 和 Qwen3-VL 上分别较 GB300 NVL72 提升最高 2.5x 和 3.7x 吞吐。
推荐理由:NVIDIA 官方公布 Vera Rubin NVL72 在 MLPerf Inference v6.1 的首秀成绩,读者可据此对比新旧平台推理吞吐与扩展效率。
Salesforce 在 Dreamforce 发布首个 CRM 推理模型 Koa,由 NVIDIA Nemotron 3 Super 后训练而来,可用 NVIDIA NeMo RL 等工具微调,训练语料覆盖 14+ 行业。
Google DeepMind 发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 模型,专注于近实时推理和语音代理。
推荐理由:Google DeepMind 发布了 Gemini 3.8 Live 系列模型,提升实时推理和语音代理能力,支持复杂任务执行与流畅对话,为开发者构建生产级语音代理提供高效工具。
GPT‑Live‑1 通过 API 推出全双工自然语音对话能力,支持更强指令遵循、自定义声音与电话渠道。开发者可借此构建更自然的语音交互应用。
GPT-6 Astra 是 OpenAI 面向商业场景的最强模型,具备高级推理、计算机使用能力,以及更强的写作与设计判断力。
Google DeepMind 发布了 AlphaGenome Atlas,提供人类基因组中 90 亿个单核苷酸变异的分子影响预测。该平台包含数千个分子效应预测,覆盖多个细胞类型,已在罕见病研究中验证变异功能。AlphaGenome Atlas 通过网站、AlphaGenome API 和 Google Antigravity 提供。
推荐理由:Google DeepMind 发布了 AlphaGenome Atlas,提供人类基因组中 90 亿个单核苷酸变异的分子影响预测,并推出 AVI 分数用于变异影响评估。
Google DeepMind 发布 WeatherNext 3,改用实时卫星观测数据直接训练全球天气 AI 模型。模型以 5 公里分辨率、每小时更新生成预报,降水预报 CRPS 最高较 IMERG 提升 60%,并已集成至 Search、Gemini、Maps 及 Google Cloud 平台。
推荐理由:WeatherNext 3 摒弃传统数值天气预报训练数据,改为直接使用实时卫星观测数据,将全球分辨率提升至5公里并实现每小时更新,降水预报CRPS最高改善60%。
NeoMME是260M和800M多模态原生多语言编码器,单塔双向Transformer从零训练,无需独立视觉塔或因果语言模型。260M模型在ViDoRe v3上达0.523 nDCG@10,超越同参数模型,编码速度约2倍于ColModernVBERT。通过分层池化和非对称量化,late-interaction存储从1.5MB压缩至6kB/页,压缩255倍且保留95%以上检索质量。
推荐理由:单塔多模态编码器以260M参数在ViDoRe v3上超越更大模型,并通过分层池化和非对称量化将多向量检索存储压缩255倍同时保留95%以上质量。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者延续 3.7 Flash 的速度与定价(每百万输入 token 0.75 美元、每百万输出 token 3.75 美元),在软件工程、智能体任务和多步推理上明显提升。
推荐理由:3.8 Flash 在相同价格下把提升集中在长周期编码与智能体任务,读者可据此判断是否替换现有生产模型。
Google Research 发布 TimesFM-3 时间序列基础模型,参数量 330M,预训练语料超过 1 万亿个时间点,原生支持多变量预测。模型可在单次前向传播中联合预测多条相关序列并输出 9 个分位数,同时支持历史协变量与已知未来协变量,无需任务级微调。
推荐理由:相比前代只做单变量预测,TimesFM-3 原生支持多变量与协变量输入,可用于零售、金融等实际预测任务。
Google DeepMind 发布 Gemini Omni 1.1 Flash,面向开发者提供场景续写、首尾帧插值、视频参考和 4K 放大等生成视频控制能力。
推荐理由:相比前代只参考最后 1 秒画面,新版本可读取 10 秒上下文并把视频续写到 40 秒,开发者可据此判断生成视频的可控程度。
Google 发布语音转文字模型 Gemini 3.5 Transcribe,据 Artificial Analysis 测试流式 WER 为 4.0%、非流式为 2.6%。
推荐理由:原文列出流式与非流式 WER、延迟改进幅度及两条 API 形态,可与 Chirp 3 对照判断升级幅度。
Hugging Face 发布 2026 年上半年开源模型观察报告,指出中国实验室在几乎每个月的前沿模型规模都超过美国模型,同时 Qwen 衍生模型达 15 万个、成为社区基础模型。下载量高度集中于小模型,GGUF 等本地推理格式增长远超模型仓库本身增速。Agent 首次成为 Hub 主要流量来源,7 月 Claude Code 占 44.4%,近四分之一流量来自未注册客户端。
推荐理由:报告揭示了开源模型格局的前沿迁移与采纳现实之间的落差,为观察中国实验室的发布策略与社区实际依赖提供了可对照的数据视角。
Google DeepMind 发布 Gemini 3.7 Flash,定位为编码与智能体工作负载的最智能基础模型,在 FrontierCode 1.1 Main(43.6% vs 34.4%)。
AWS Trainium Frontier 竞赛邀请学术和工业界团队在 Trainium2 上从零训练语言模型,探索模型架构、优化器、训练循环与 NKI 自定义内核的全栈设计。
推荐理由:AWS Trainium Frontier 竞赛让参与者在固定训练预算下从零训练语言模型,探索硬件原生架构与自定义内核的协同设计空间。
NVIDIA 发布 364M 参数的开源语音合成模型 Magpie TTS Multilingual,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并提供男声与女声。
Meta 发布 30B 参数多模态模型 Muse Glimmer,由 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地智能体场景。
推荐理由:原文给出 30B 多模态模型在同级开放模型中的基准对照,可据此判断本地智能体方案与部署路径的选型空间。
Google DeepMind 发布 WeatherNext 模型,在气旋路径、强度和风场预测上平均比前代多出一天预报精度,相当于十年气象进展。该模型已在 Nature 发表论文,并在 2025 年飓风季帮助 NHC 对 Hurricane Melissa 做出历史性预报。
推荐理由:该模型在气旋路径、强度和风场预测上平均多出一天预报精度,相当于十年气象学进展,并已开源模型与代码供研究社区使用。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载。它把内容审核建模为推理时传入纯语言策略的问答任务,无需重新训练即可适配新策略,在文本安全上匹配最高 7 倍规模的开源 guard 模型,并在多模态审核上刷新 SOTA。模型可在单张 16GB NVIDIA GPU 上运行。
Kimi K3 是 Moonshot AI 发布的 2.8 万亿参数开源模型,是全球首个 3 万亿参数量级的开源模型,支持 1M 上下文长度,在 Together AI 上提供 OpenAI 兼容 API。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google DeepMind 发布 Gemini Robotics ER 2,具身推理模型,在视频理解与任务编排上较 ER 1.6 实现显著升级,并支持多机器人协作。
推荐理由:Gemini Robotics ER 2 在视频理解与任务编排上较 ER 1.6 实现显著升级,支持多机器人协作与实时推理,为物理世界中的具身智能提供了新的能力基准。
Google 在 Flow Music 中上线新一代音乐生成模型 Lyria 3.5,在音乐性、歌词、人声质量和创作控制四方面带来提升。该模型可生成更复杂自然、旋律结构更丰富的作品,歌词的提示词遵循与结构意识更好,人声更具情感表现力且发音改善,用户还能更便捷地控制输出节奏与时长。
ThunderAgent 在单 8×H100 节点上相对 SGLang 达到 2.5 倍吞吐量、P50 延迟降低约 10 倍,8 节点集群实现 2.4 倍加速且接近线性扩展。
推荐理由:把多轮 agent 请求视为程序而非独立请求,让 KV cache 命中率提升并缓解多节点负载不均。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型分别实现全身体控制、具身推理与设备端适配。该模型可控制人形机器人完成行走、蹲伏、灵巧操作等复杂任务,ER 2 已在 Google AI Studio 和 Gemini Enterprise Agent Platform 开放预览,VLA 与设备端模型面向早期合作方开放。
推荐理由:Gemini Robotics 2 首次实现全身体控制、灵巧操作与多机器人协作,并在设备上快速适配新机体形态,为通用物理 AI 提供了新的能力基线。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。
推荐理由:新模型在 token 效率和成本上较 3.5 Flash 显著提升,3.5 Flash-Lite 以更高吞吐和更低延迟面向规模化 agentic 工作流。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 Gemini 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
Thinking Machines Lab 发布 Inkling,Together AI 在发布当日将其上线至 Serverless 推理平台。Inkling 是 975B 总参数、40B 活跃参数的混合专家模型,支持 1M 上下文、接受文本、图像和音频输入并输出文本,提供可控推理强度设定,并在科学推理、数学、代码、预测等任务上进行了后训练。
推荐理由:原文给出 Inkling 的参数规模、上下文长度和可控推理设定,开发者可据此评估它在推理深度与 token 开销之间的平衡。
Inkling 由 Thinking Machines 发布,是一个原生接收图像、文本和音频输入的大规模多模态开源模型,总参数约 1T、活跃参数 41B,支持 1M 上下文窗口。
推荐理由:Inkling 是原生接收图音文三模态的大规模开源模型,提供 BF16 与 NVFP4 双版本及 day-0 支持的推理引擎,读者可据此评估其在多模态推理基准中的相对位置。
Robostral Navigate 是 Mistral AI 推出的8B具身导航模型,仅用单RGB相机在未见R2R-CE基准上达76.6%成功率,比多传感器方案高4.5分。模型完全自研、仅用仿真数据训练,借助前缀缓存将训练token减少22倍,再通过CISPO在线强化学习进一步提升3.2%成功率。
Mistral 发布 Leanstral 1.5,这是一个 Apache-2.0 许可的 Lean 4 形式验证模型,119B 总参数、6B 激活参数。它在 miniF2F 上达到 100%,解出 PutnamBench 587/672 题,FATE-H 为 87%、FATE-X 为 34%,权重已在 Hugging Face 开源并提供免费 API。
summary_zh: BAIR 2026 届博士毕业生涵盖机器人与具身智能、大语言模型与推理、计算机视觉、生成式建模、AI 安全、人机交互、AI for Science 等方向。