跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 41–60 条 · 共 60 条
6月2日周二
  1. Together AI73

    MiniMax M3 发布:1M 上下文与原生多模态及高效推理实践

    MiniMax 发布 M3,Together AI 作为首选云伙伴支持其生产级部署。M3 支持 1M token 上下文、原生多模态与智能体工作流,采用 MiniMax Sparse Attention 实现 prefill 加速 9 倍、decode 加速 15 倍以上。

    推荐理由:原文展示了稀疏注意力与多模态预处理的工程细节,读者可据此评估长上下文与多模态场景下的推理优化路径。

5月22日周五
5月18日周一
  1. Google DeepMind69

    Google DeepMind 发布 Gemini Omni Flash

    Google DeepMind 发布 Gemini Omni Flash,支持图像音频视频文本多模态输入生成视频并通过自然语言对话编辑,模型融合物理理解与世界知识推理。该模型今日起面向 Gemini app、Google Flow 及 YouTube Shorts 开放,所有视频均带有 SynthID 数字水印。

    推荐理由:Google DeepMind 发布 Gemini Omni Flash,将推理与创造能力结合,支持图像音频视频文本多模态输入生成视频并可通过对话编辑,为视频创作提供了融合物理理解与世界知识的生成新路径。

5月16日周六
  1. Google DeepMind83

    Gemini 3.5 Flash 发布:前沿智能与智能体能力

    Google DeepMind 发布 Gemini 3.5 Flash,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)和 CharXiv Reasoning(84.2%)上表现领先,输出速度比其他前沿模型快 4 倍。

    推荐理由:原文给出 Flash 在多个基准上的具体分数与速度倍数,读者可据此对比其与上一代 Pro 的能力变化。

5月11日周一
4月24日周五
  1. Together AI70

    Together AI 发布分布感知推测解码 DAS,RL 展开加速最高 50%

    Together AI 推出分布感知推测解码(DAS)框架,通过自适应后缀树推测器和长度感知调度,在数学和代码 RL 后训练中分别实现 50% 和 25% 的展开时间缩减,且不损失奖励质量。https://www.together.ai/blog/distribution-aware-speculative-decoding

    推荐理由:原文给出了无损加速框架和实验数据,读者可据此评估是否在自己的 RL 后训练流程中引入 DAS。

4月15日周三
  1. Together AI67

    Parcae:基于稳定循环架构以更少参数实现更强性能

    Together AI 发布 Parcae,一种稳定的循环语言模型架构,在相同数据和参数下比先前循环模型降低最多 6.3% 验证困惑度。770M Parcae 达到与 1.3B Transformer 相当的质量,并给出循环次数的幂律缩放关系。团队已开源训练代码与模型。

    推荐理由:原文给出具体困惑度对比与参数减半效果,读者可据此评估循环架构在边缘部署中的实际参数效率。

4月3日周五
  1. Google DeepMind82

    Gemma 4 发布:字节级对齐的最强开源模型家族

    Google DeepMind 发布 Gemma 4 开源模型家族,提供 Effective 2B、Effective 4B、26B MoE 与 31B Dense 四种规格,31B 在 Arena AI 文本榜位列全球第 3,26B 位列第 6。模型原生支持多模态、函数调用、128K–256K 上下文与 140+ 语言,并采用 Apache 2.0 许可证。

    推荐理由:原文给出 Gemma 4 四种规格与 Arena 排名,读者可据此评估本地部署与边缘场景的可行性。

3月31日周二
  1. Together AI76

    Aurora:基于 RL 的自适应推测解码框架发布

    Together AI 发布开源框架 Aurora,将推测解码改为由在线推理 trace 持续训练 draft 模型的飞轮。在 Qwen3 和 Llama3 上比已训好的静态 speculator 额外提速 1.25x;域切换后约 10,000 个请求恢复接受长度;混合流量下从零在线训练 acceptance length 达 3.08、吞吐 302.3 tokens/s。代码已开源。

    推荐理由:把 speculative decoding 从静态离线训练改成在线自适应飞轮,对已训好的静态 speculator 能再叠加 1.25x 加速。

3月17日周二
  1. Mistral AI69

    Mistral AI 发布 Mistral Small 4

    Mistral AI 发布 Mistral Small 4,统一推理、多模态与编码能力,Apache 2.0 开源许可。模型采用 MoE 架构,119B 总参数含 6B 激活参数,支持 256k 上下文,延迟优化下完成时间减少 40%、吞吐优化下每秒请求数提升 3 倍。来源:https://mistral.ai/news/mistral-small-4/

    推荐理由:Mistral Small 4 将推理、多模态与编码能力整合进单一开源模型,用户无需在多个专用模型间切换即可处理复杂任务与文档分析。

3月11日周三
  1. Together AI64

    Together AI 在 Day 0 上线 NVIDIA Nemotron 3 Super

    Together AI 将 NVIDIA Nemotron 3 Super 带给开发者,模型为 120B 参数(12B 激活)的混合 MoE 架构,支持 1M token 上下文和多 Token 预测,并在 AIME 2025 与 SWE Bench Verified 上达到领先精度。

    推荐理由:原文同时给出单GPU部署和1M上下文等具体能力,读者可据此判断它能否直接承载多智能体与大上下文推理工作流。

3月5日周四
  1. Together AI72

    FlashAttention-4:面向 Blackwell 非对称硬件的算法与 Kernel 协同设计

    FlashAttention-4 在 B200 上 BF16 最高达 1605 TFLOPs/s(71% 利用率),比 cuDNN 9.13 快 1.3×、比 Triton 快 2.7×。通过前向 softmax 与 MMA 重叠、TMEM 缓存中间结果、2-CTA MMA 降共享内存流量,以及确定性模式提升可复现性。

    推荐理由:原文给出了 B200 上的具体吞吐数据和对比倍数,读者可据此评估 FlashAttention-4 在实际训练中的加速潜力。

12月9日周二
12月3日周三
  1. Mistral AI87

    Mistral 3 发布:涵盖 Ministral 3 与 Mistral Large 3 的开源模型家族

    Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。

    推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。

7月15日周二
  1. Mistral AI69

    Mistral AI 发布 Voxtral 语音理解模型

    Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均采用 Apache 2.0 开源许可。模型支持最长 30 分钟音频转录和 40 分钟理解,内置问答与摘要功能,并原生支持多语言自动识别。

    推荐理由:Voxtral以不到同类API一半的价格提供接近商用水平的语音理解能力,为开源ASR与闭源服务之间的鸿沟提供了可部署的替代方案。

7月11日周五
  1. Mistral AI63

    Mistral AI 发布 Devstral Medium 与 Devstral Small 1.1 代码智能体模型

    Mistral AI 与 All Hands AI 合作发布 Devstral Medium 和 Devstral Small 1.1 代码智能体模型。Devstral Small 1.1 以 Apache 2.0 开源,SWE-Bench Verified 达 53.6%,为开源无测试时缩放模型新标杆。

    推荐理由:Devstral Small 1.1 在 SWE-Bench Verified 上达 53.6% 成为开源代码智能体新标杆,Devstral Medium 以四分之一价格超越 Gemini 2.5 Pro 和 GPT-4.1。

6月10日周二
  1. Mistral AI74

    Mistral 发布首个推理模型 Magistral

    Mistral AI 发布首个推理模型 Magistral,分开源的 Magistral Small(24B)与企业版 Magistral Medium;Magistral Medium 在 AIME2024 得分 73.6%,多数投票 @64 达 90%,Small 分别为 70.7% 与 83.3%。

    推荐理由:Mistral 首次推出推理模型 Magistral,分开源与企业两个版本,读者可据此对比其推理能力与部署选择。

5月21日周三
  1. Mistral AI65

    Devstral:Mistral AI 发布开源智能体编程模型

    Devstral 是 Mistral AI 与 All Hands AI 合作开发的开源智能体编程模型,在 SWE-Bench Verified 上得分 46.8%,领先开源 SoTA 超过 6 个百分点。

    推荐理由:Devstral以46.8%的SWE-Bench Verified成绩超越多数闭源模型,且可本地部署,读者可据此评估开源方案在真实软件工程任务中的可行性。

5月7日周三
  1. Mistral AI62

    Mistral 发布 Mistral Medium 3

    Mistral 发布 Mistral Medium 3,宣称以显著更低成本提供接近前沿大模型的性能。模型在编码与 STEM 任务上接近更大更慢的竞品,API 定价为输入 $0.4 / 输出 $2 每百万 token,可在四卡及以上自托管环境部署。

    推荐理由:原文给出性能与成本对比,读者可据此判断它对现有开源大模型格局的影响。