MIT提出HardFlow方法使生成AI适用于安全关键场景
MIT研究人员提出HardFlow算法,通过在生成过程末端而非中间步骤强制硬约束,使扩散模型和流匹配模型在机器人路径规划等安全关键场景中既满足严格约束又提升解质量。实验表明HardFlow在机器人操作、迷宫导航和文本引导图像编辑中实现完美约束满足,并在解质量上持续超越基线,计算时间与多数方法相当或更低。
推荐理由:该方法在部署时即可对预训练生成模型施加硬约束而不重新训练,为机器人等安全关键场景提供了可即插即用的改进路径。
MIT研究人员提出HardFlow算法,通过在生成过程末端而非中间步骤强制硬约束,使扩散模型和流匹配模型在机器人路径规划等安全关键场景中既满足严格约束又提升解质量。实验表明HardFlow在机器人操作、迷宫导航和文本引导图像编辑中实现完美约束满足,并在解质量上持续超越基线,计算时间与多数方法相当或更低。
推荐理由:该方法在部署时即可对预训练生成模型施加硬约束而不重新训练,为机器人等安全关键场景提供了可即插即用的改进路径。
Sebastian Raschka 分享了对 GPT-6 Astra 的使用印象,指出其在 3D 渲染、动画、ARC-AGI-3(99.9%)等任务上表现突出,并探讨了循环变压器架构与隐藏推理链的传闻。
GPT-6 Astra 是 OpenAI 面向商业场景的最强模型,具备高级推理、计算机使用能力,以及更强的写作与设计判断力。
Interconnects 汇总了最新开源模型与许可证动态:Motif-3 采用 MIT 许可证并以有限资源取得亮眼成绩;GLM-5.3 从 MIT 转为自定义许可证,对推理与微调服务设置 100 亿美元营收门槛及安全审查;Hy4-preview 延续了腾讯模型迭代路径但存在过度思考问题;Qwen3.8-Flash-Next 展示了 125B-A6B 架构与 GDN 等新技术。
OpenAI 数学团队于 9 月 8 日宣布,10,000 个自主 AI 智能体在其指导下运行一款未公开的高级模型,在三维 Navier-Stokes 方程中找到了一个“奇点”,从而解决 Clay 数学研究所 2000 年提出的六个千年奖难题之一。剩余五个千年奖问题仍未解决。该模型未向公众开放。
Google DeepMind 发布 WeatherNext 3,改用实时卫星观测数据直接训练全球天气 AI 模型。模型以 5 公里分辨率、每小时更新生成预报,降水预报 CRPS 最高较 IMERG 提升 60%,并已集成至 Search、Gemini、Maps 及 Google Cloud 平台。
推荐理由:WeatherNext 3 摒弃传统数值天气预报训练数据,改为直接使用实时卫星观测数据,将全球分辨率提升至5公里并实现每小时更新,降水预报CRPS最高改善60%。
NeoMME是260M和800M多模态原生多语言编码器,单塔双向Transformer从零训练,无需独立视觉塔或因果语言模型。260M模型在ViDoRe v3上达0.523 nDCG@10,超越同参数模型,编码速度约2倍于ColModernVBERT。通过分层池化和非对称量化,late-interaction存储从1.5MB压缩至6kB/页,压缩255倍且保留95%以上检索质量。
推荐理由:单塔多模态编码器以260M参数在ViDoRe v3上超越更大模型,并通过分层池化和非对称量化将多向量检索存储压缩255倍同时保留95%以上质量。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者延续 3.7 Flash 的速度与定价(每百万输入 token 0.75 美元、每百万输出 token 3.75 美元),在软件工程、智能体任务和多步推理上明显提升。
推荐理由:3.8 Flash 在相同价格下把提升集中在长周期编码与智能体任务,读者可据此判断是否替换现有生产模型。
Google Research 发布 TimesFM-3 时间序列基础模型,参数量 330M,预训练语料超过 1 万亿个时间点,原生支持多变量预测。模型可在单次前向传播中联合预测多条相关序列并输出 9 个分位数,同时支持历史协变量与已知未来协变量,无需任务级微调。
推荐理由:相比前代只做单变量预测,TimesFM-3 原生支持多变量与协变量输入,可用于零售、金融等实际预测任务。
IBM 与芝加哥大学团队通过新编码量子电路,用 70 个逻辑量子比特完成经典模拟难以处理的任务,耗时约 15 分钟,同时给出高保真度的可验证结果。实验包含约 2415 次逻辑两比特操作和 468 次逻辑 T 门,逻辑错误率比物理错误率低约 10 倍,相关电路与结果已通过 Quantum Advantage Tracker 公开。
推荐理由:在经典模拟不可行的背景下,提供了可验证的量子优势实验路径。
Google DeepMind 发布 Gemini Omni 1.1 Flash,面向开发者提供场景续写、首尾帧插值、视频参考和 4K 放大等生成视频控制能力。
推荐理由:相比前代只参考最后 1 秒画面,新版本可读取 10 秒上下文并把视频续写到 40 秒,开发者可据此判断生成视频的可控程度。
Google 发布语音转文字模型 Gemini 3.5 Transcribe,据 Artificial Analysis 测试流式 WER 为 4.0%、非流式为 2.6%。
推荐理由:原文列出流式与非流式 WER、延迟改进幅度及两条 API 形态,可与 Chirp 3 对照判断升级幅度。
IBM Granite 4.2 推理模型家族(3B/8B/30B)采用分阶段强化学习流水线构建,支持思考/非思考切换与低思考预算模式。8B 与 30B 经过智能体 RL 训练,可在真实沙盒环境中进行代码编辑、终端操作与网页搜索,训练基于 NeMo-RL 与 NeMo-Gym,最终以 Apache 2.0 许可证开源。
推荐理由:详细展示了从可验证奖励到智能体环境交互的分阶段强化学习流水线,为构建具备工具调用能力的推理模型提供了可复现的训练框架。
Together AI 在 113 个 DeepSWE 任务、每侧 452 次 rollout 上对比 GLM-5.3(max)与 GPT-5.6 Sol(max)。
推荐理由:同一跑道上 GLM-5.3 以一半价格逼近 Sol,在重试和覆盖率上反而反超,读者可据此设计前端开源、后端旗舰的级联路由。
Together AI 在 DeepSWE 上对比 GLM-5.3 与 Claude Fable 5:首次尝试通过率 69.0% vs 69.7%,GLM-5.3 每次调用 $3.99。
推荐理由:在精度相近时,GLM-5.3 以五分之一成本覆盖更多任务,为预算有限的工程团队提供了清晰的选型与路由依据。
Liquid AI发布LFM2.5-DSpark推测解码草稿模型,为LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B三款模型提供最高3.2倍GPU加速与最高2.87倍端侧加速。函数调用延迟平均降低57%,llama.cpp与SGLang已支持首日集成。
Together AI 在 DeepSWE 基准上对比 DeepSeek V4 Pro 0813 与 Claude Fable 5:Fable 首试准确率 69.7% 高于 Pro 的 62.8%。
推荐理由:在 DeepSWE 评测中两款模型价格相差 90 倍但表现接近,读者可据此判断何时值得为 Fable 支付溢价。
Z.ai 发布 GLM-5.3,目前仅在编码计划中可用,两周后开放权重并上线 Hugging Face。该模型在多个基准上超越 Kimi K3、Claude Fable 5 和 GPT-5.6-Sol,参数量仅约 750B,约为 Kimi K3 的三分之一。
推荐理由:在参数规模明显更小的情况下,GLM-5.3 在智能体编码基准上逼近前沿,读者可借此观察中国实验室的训练策略与美国厂商的发布节奏差异。
Google DeepMind 发布 Gemini 3.7 Flash,定位为编码与智能体工作负载的最智能基础模型,在 FrontierCode 1.1 Main(43.6% vs 34.4%)。
AMIE (Video) 在实时视频临床咨询中达到专家级表现,基于Gemini和Project Astra,采用异步三智能体架构。在100个场景、300次标准化咨询的随机OSCE研究中,其临床能力与执业医师持平,且在体格观察和指导方面评分更高。
推荐理由:演示AI在实时视频临床咨询中达到专家级表现,多智能体架构平衡了对话速度与临床推理。
NVIDIA 发布 364M 参数的开源语音合成模型 Magpie TTS Multilingual,支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并提供男声与女声。
Nathan Lambert 发布由 Manning 出版的后训练教材《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》,配套 12 小时课程、代码练习与模型对比。书中覆盖 RL 算法直觉、系统设计因素、后训练历史、蒸馏以及过拟合与评估等常见陷阱,并强调理解研究价值与产业落地节奏。
Meta 发布 30B 参数多模态模型 Muse Glimmer,由 Muse 蒸馏而来,采用 Apache 2.0 许可,面向本地智能体场景。
推荐理由:原文给出 30B 多模态模型在同级开放模型中的基准对照,可据此判断本地智能体方案与部署路径的选型空间。
Google DeepMind 发布 WeatherNext 模型,在气旋路径、强度和风场预测上平均比前代多出一天预报精度,相当于十年气象进展。该模型已在 Nature 发表论文,并在 2025 年飓风季帮助 NHC 对 Hurricane Melissa 做出历史性预报。
推荐理由:该模型在气旋路径、强度和风场预测上平均多出一天预报精度,相当于十年气象学进展,并已开源模型与代码供研究社区使用。
Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,以 Apache 2.0 许可开放下载。它把内容审核建模为推理时传入纯语言策略的问答任务,无需重新训练即可适配新策略,在文本安全上匹配最高 7 倍规模的开源 guard 模型,并在多模态审核上刷新 SOTA。模型可在单张 16GB NVIDIA GPU 上运行。
Interconnects 复盘最新开放模型动态,指出多家公司持续投入训练并以开放方式发布模型,Thinking Machines 的 Inkling 与 Poolside 的 Laguna S2.1 等均在 Pareto 前沿有表现。DeepSeek-V4-Flash 在 OpenAI 降价后更新,Kimi K3 采用非商业许可并引发关于美国政策工具的讨论。
Google DeepMind 发布 Gemini Robotics ER 2,具身推理模型,在视频理解与任务编排上较 ER 1.6 实现显著升级,并支持多机器人协作。
推荐理由:Gemini Robotics ER 2 在视频理解与任务编排上较 ER 1.6 实现显著升级,支持多机器人协作与实时推理,为物理世界中的具身智能提供了新的能力基准。
Google 在 Flow Music 中上线新一代音乐生成模型 Lyria 3.5,在音乐性、歌词、人声质量和创作控制四方面带来提升。该模型可生成更复杂自然、旋律结构更丰富的作品,歌词的提示词遵循与结构意识更好,人声更具情感表现力且发音改善,用户还能更便捷地控制输出节奏与时长。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型分别实现全身体控制、具身推理与设备端适配。该模型可控制人形机器人完成行走、蹲伏、灵巧操作等复杂任务,ER 2 已在 Google AI Studio 和 Gemini Enterprise Agent Platform 开放预览,VLA 与设备端模型面向早期合作方开放。
推荐理由:Gemini Robotics 2 首次实现全身体控制、灵巧操作与多机器人协作,并在设备上快速适配新机体形态,为通用物理 AI 提供了新的能力基线。
summary_zh: Dimitri Bertsekas 博士毕业于 MIT,曾任 MIT EECS 荣誉教授、LIDS 研究员及亚利桑那州立大学计算决策教授,于 6 月 3 日在马萨诸塞州贝尔蒙特家中去世,享年 83 岁。
Nathan Lambert与Florian Brand讨论了Kimi K3发布后的开源模型格局,包括GLM 5.2的持续角色、中国模型性能提升的资本与数据因素、蒸馏在RL阶段的作用争议,以及中美开放模型生态的基础设施差距。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。
推荐理由:新模型在 token 效率和成本上较 3.5 Flash 显著提升,3.5 Flash-Lite 以更高吞吐和更低延迟面向规模化 agentic 工作流。
Moonshot AI 于 7 月 16 日发布 2.8T 参数 MoE 模型 Kimi K3,权重将于 7 月 27 日开放。在 Vals AI Index 排名第 2,Artificial Analysis 智力指数排名第 3(仅次于 Claude Fable 与 GPT-5.6 Sol Max),在 Frontend Code Arena 排名第 1。
推荐理由:K3 让开放权重模型首次逼近前沿,读者可据此重新评估开放与闭源模型的能力差距及扩散节奏。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 Gemini 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞。
DharmaOCR 通过领域专精与两阶段训练(监督微调 + DPO),在巴西葡萄牙语基准上得分 0.925,显著高于 Mistral OCR4 的 0.798 与 Unlimited-OCR 的 0.7587。监督微调将参数集中于巴西葡萄牙语的词汇、句法与文档结构,DPO 阶段则降低推理时的退化率与不稳定输出。两阶段缺一不可:微调建立领域能力,DPO 确保该能力在生产条件下稳定。
Thinking Machines Lab 发布 Inkling,Together AI 在发布当日将其上线至 Serverless 推理平台。Inkling 是 975B 总参数、40B 活跃参数的混合专家模型,支持 1M 上下文、接受文本、图像和音频输入并输出文本,提供可控推理强度设定,并在科学推理、数学、代码、预测等任务上进行了后训练。
推荐理由:原文给出 Inkling 的参数规模、上下文长度和可控推理设定,开发者可据此评估它在推理深度与 token 开销之间的平衡。
Inkling 由 Thinking Machines 发布,是一个原生接收图像、文本和音频输入的大规模多模态开源模型,总参数约 1T、活跃参数 41B,支持 1M 上下文窗口。
推荐理由:Inkling 是原生接收图音文三模态的大规模开源模型,提供 BF16 与 NVFP4 双版本及 day-0 支持的推理引擎,读者可据此评估其在多模态推理基准中的相对位置。
Robostral Navigate 是 Mistral AI 推出的8B具身导航模型,仅用单RGB相机在未见R2R-CE基准上达76.6%成功率,比多传感器方案高4.5分。模型完全自研、仅用仿真数据训练,借助前缀缓存将训练token减少22倍,再通过CISPO在线强化学习进一步提升3.2%成功率。
Mistral 发布 Leanstral 1.5,这是一个 Apache-2.0 许可的 Lean 4 形式验证模型,119B 总参数、6B 激活参数。它在 miniF2F 上达到 100%,解出 PutnamBench 587/672 题,FATE-H 为 87%、FATE-X 为 34%,权重已在 Hugging Face 开源并提供免费 API。
summary_zh: BAIR 2026 届博士毕业生涵盖机器人与具身智能、大语言模型与推理、计算机视觉、生成式建模、AI 安全、人机交互、AI for Science 等方向。