MiniMax M3 发布:1M 上下文与原生多模态及高效推理实践
MiniMax 发布 M3,Together AI 作为首选云伙伴支持其生产级部署。M3 支持 1M token 上下文、原生多模态与智能体工作流,采用 MiniMax Sparse Attention 实现 prefill 加速 9 倍、decode 加速 15 倍以上。
推荐理由:原文展示了稀疏注意力与多模态预处理的工程细节,读者可据此评估长上下文与多模态场景下的推理优化路径。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
MiniMax 发布 M3,Together AI 作为首选云伙伴支持其生产级部署。M3 支持 1M token 上下文、原生多模态与智能体工作流,采用 MiniMax Sparse Attention 实现 prefill 加速 9 倍、decode 加速 15 倍以上。
推荐理由:原文展示了稀疏注意力与多模态预处理的工程细节,读者可据此评估长上下文与多模态场景下的推理优化路径。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密开源权重模型,具备 256k 上下文窗口,在 SWE-Bench Verified 上得分 77.6%。
推荐理由:128B 开源权重模型把编码智能体搬到云端,读者可据此判断自托管与异步并行任务的取舍。
Google DeepMind 发布 Gemini Omni Flash,支持图像音频视频文本多模态输入生成视频并通过自然语言对话编辑,模型融合物理理解与世界知识推理。该模型今日起面向 Gemini app、Google Flow 及 YouTube Shorts 开放,所有视频均带有 SynthID 数字水印。
推荐理由:Google DeepMind 发布 Gemini Omni Flash,将推理与创造能力结合,支持图像音频视频文本多模态输入生成视频并可通过对话编辑,为视频创作提供了融合物理理解与世界知识的生成新路径。
Google DeepMind 发布 Gemini 3.5 Flash,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上表现领先,输出速度比其他前沿模型快 4 倍。
推荐理由:原文给出 Flash 在多个基准上的具体分数与速度倍数,读者可据此对比其与上一代 Pro 的能力变化。
DeepSeek-V4 支持 1M 上下文窗口,通过 CSA/HCA/SWA 混合注意力在 token 轴压缩 KV 缓存。在 NVIDIA HGX B200 上,缓存策略使单节点 KV 容量从约 1.2M token 提升至 3.7M token。
推荐理由:V4 把百万上下文变成系统问题,读者可据此判断自身负载是否落在压缩注意力与缓存策略的有效区间。
Together AI 推出分布感知推测解码(DAS)框架,通过自适应后缀树推测器和长度感知调度,在数学和代码 RL 后训练中分别实现 50% 和 25% 的展开时间缩减,且不损失奖励质量。https://www.together.ai/blog/distribution-aware-speculative-decoding
推荐理由:原文给出了无损加速框架和实验数据,读者可据此评估是否在自己的 RL 后训练流程中引入 DAS。
Together AI 发布 Parcae,一种稳定的循环语言模型架构,在相同数据和参数下比先前循环模型降低最多 6.3% 验证困惑度。770M Parcae 达到与 1.3B Transformer 相当的质量,并给出循环次数的幂律缩放关系。团队已开源训练代码与模型。
推荐理由:原文给出具体困惑度对比与参数减半效果,读者可据此评估循环架构在边缘部署中的实际参数效率。
Google DeepMind 发布 Gemma 4 开源模型家族,提供 Effective 2B、Effective 4B、26B MoE 与 31B Dense 四种规格,31B 在 Arena AI 文本榜位列全球第 3,26B 位列第 6。模型原生支持多模态、函数调用、128K–256K 上下文与 140+ 语言,并采用 Apache 2.0 许可证。
推荐理由:原文给出 Gemma 4 四种规格与 Arena 排名,读者可据此评估本地部署与边缘场景的可行性。
Together AI 发布开源框架 Aurora,将推测解码改为由在线推理 trace 持续训练 draft 模型的飞轮。在 Qwen3 和 Llama3 上比已训好的静态 speculator 额外提速 1.25x;域切换后约 10,000 个请求恢复接受长度;混合流量下从零在线训练 acceptance length 达 3.08、吞吐 302.3 tokens/s。代码已开源。
推荐理由:把 speculative decoding 从静态离线训练改成在线自适应飞轮,对已训好的静态 speculator 能再叠加 1.25x 加速。
Together AI 联合 CMU、Princeton、Cartesia AI 发布 Mamba-3,一种以推理效率为主要目标的新状态空间模型(SSM)。
推荐理由:Mamba-3以推理效率为核心重新设计SSM,在1.5B规模上对延迟与精度给出了可对比的实测结果。
Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码能力,Apache 2.0 开源许可。模型采用 MoE 架构,119B 总参数含 6B 激活参数,支持 256k 上下文,延迟优化下完成时间减少 40%、吞吐优化下每秒请求数提升 3 倍。来源:https://mistral.ai/news/mistral-small-4/
推荐理由:Mistral Small 4 将推理、多模态与编码能力整合进单一开源模型,用户无需在多个专用模型间切换即可处理复杂任务与文档分析。
Together AI 将 NVIDIA Nemotron 3 Super 带给开发者,模型为 120B 参数(12B 激活)的混合 MoE 架构,支持 1M token 上下文和多 Token 预测,并在 AIME 2025 与 SWE Bench Verified 上达到领先精度。
推荐理由:原文同时给出单GPU部署和1M上下文等具体能力,读者可据此判断它能否直接承载多智能体与大上下文推理工作流。
FlashAttention-4 在 B200 上 BF16 最高达 1605 TFLOPs/s(71% 利用率),比 cuDNN 9.13 快 1.3×、比 Triton 快 2.7×。通过前向 softmax 与 MMA 重叠、TMEM 缓存中间结果、2-CTA MMA 降共享内存流量,以及确定性模式提升可复现性。
推荐理由:原文给出了 B200 上的具体吞吐数据和对比倍数,读者可据此评估 FlashAttention-4 在实际训练中的加速潜力。
Mistral AI 发布 Devstral 2 编码模型系列,包含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,并推出配套开源 CLI Mistral Vibe。
推荐理由:官方给出参数规模、基准得分与人类评估胜率,可对照开源与闭源编码模型的能力与成本差距。
Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。
推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均采用 Apache 2.0 开源许可。模型支持最长 30 分钟音频转录和 40 分钟理解,内置问答与摘要功能,并原生支持多语言自动识别。
推荐理由:Voxtral以不到同类API一半的价格提供接近商用水平的语音理解能力,为开源ASR与闭源服务之间的鸿沟提供了可部署的替代方案。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium 和 Devstral Small 1.1 代码智能体模型。Devstral Small 1.1 以 Apache 2.0 开源,SWE-Bench Verified 达 53.6%,为开源无测试时缩放模型新标杆。
推荐理由:Devstral Small 1.1 在 SWE-Bench Verified 上达 53.6% 成为开源代码智能体新标杆,Devstral Medium 以四分之一价格超越 Gemini 2.5 Pro 和 GPT-4.1。
Mistral AI 发布首个推理模型 Magistral,分开源的 Magistral Small(24B)与企业版 Magistral Medium;Magistral Medium 在 AIME2024 得分 73.6%,多数投票 @64 达 90%,Small 分别为 70.7% 与 83.3%。
推荐理由:Mistral 首次推出推理模型 Magistral,分开源与企业两个版本,读者可据此对比其推理能力与部署选择。
Devstral 是 Mistral AI 与 All Hands AI 合作开发的开源智能体编程模型,在 SWE-Bench Verified 上得分 46.8%,领先开源 SoTA 超过 6 个百分点。
推荐理由:Devstral以46.8%的SWE-Bench Verified成绩超越多数闭源模型,且可本地部署,读者可据此评估开源方案在真实软件工程任务中的可行性。
Mistral 发布 Mistral Medium 3,宣称以显著更低成本提供接近前沿大模型的性能。模型在编码与 STEM 任务上接近更大更慢的竞品,API 定价为输入 $0.4 / 输出 $2 每百万 token,可在四卡及以上自托管环境部署。
推荐理由:原文给出性能与成本对比,读者可据此判断它对现有开源大模型格局的影响。