Skip to content

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

101 selectedRelated topics产品更新论文研究开源生态

Latest selected

61–80 of 101
Aug 11Tue
  1. Amazon Science72

    AWS Trainium Frontier 竞赛:在专用 AI 芯片上协同设计模型与内核

    AWS Trainium Frontier 竞赛邀请学术和工业界团队在 Trainium2 上从零训练语言模型,探索模型架构、优化器、训练循环与 NKI 自定义内核的全栈设计。

    Why it matters: AWS Trainium Frontier 竞赛让参与者在固定训练预算下从零训练语言模型,探索硬件原生架构与自定义内核的协同设计空间。

Aug 10Mon
Aug 6Thu
  1. Google DeepMind76

    WeatherNext AI 模型在气旋预报上实现突破,预测精度平均提前一天

    Google DeepMind 发布 WeatherNext 模型,在气旋路径、强度和风场预测上平均比前代多出一天预报精度,相当于十年气象进展。该模型已在 Nature 发表论文,并在 2025 年飓风季帮助 NHC 对 Hurricane Melissa 做出历史性预报。

    Why it matters: 该模型在气旋路径、强度和风场预测上平均多出一天预报精度,相当于十年气象学进展,并已开源模型与代码供研究社区使用。

Aug 1Sat
Jul 30Thu
  1. Google DeepMind66

    Gemini Robotics ER 2 发布:赋能机器人视频理解、任务编排与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2,具身推理模型,在视频理解与任务编排上较 ER 1.6 实现显著升级,并支持多机器人协作。

    Why it matters: Gemini Robotics ER 2 在视频理解与任务编排上较 ER 1.6 实现显著升级,支持多机器人协作与实时推理,为物理世界中的具身智能提供了新的能力基准。

Jul 29Wed
Jul 28Tue
  1. Google DeepMind64

    Gemini Robotics 2 带来机器人的全身体智能

    Google DeepMind 发布 Gemini Robotics 2,包含三款模型分别实现全身体控制、具身推理与设备端适配。该模型可控制人形机器人完成行走、蹲伏、灵巧操作等复杂任务,ER 2 已在 Google AI Studio 和 Gemini Enterprise Agent Platform 开放预览,VLA 与设备端模型面向早期合作方开放。

    Why it matters: Gemini Robotics 2 首次实现全身体控制、灵巧操作与多机器人协作,并在设备上快速适配新机体形态,为通用物理 AI 提供了新的能力基线。

Jul 21Tue
Jul 20Mon
  1. Interconnects85

    Kimi K3:开放权重的前沿升级

    Moonshot AI 于 7 月 16 日发布 2.8T 参数 MoE 模型 Kimi K3,权重将于 7 月 27 日开放。在 Vals AI Index 排名第 2,Artificial Analysis 智力指数排名第 3(仅次于 Claude Fable 与 GPT-5.6 Sol Max),在 Frontend Code Arena 排名第 1。

    Why it matters: K3 让开放权重模型首次逼近前沿,读者可据此重新评估开放与闭源模型的能力差距及扩散节奏。

Jul 15Wed
  1. Together AI75

    Thinking Machines Lab 发布多模态推理模型 Inkling,Together AI 首日上线

    Thinking Machines Lab 发布 Inkling,Together AI 在发布当日将其上线至 Serverless 推理平台。Inkling 是 975B 总参数、40B 活跃参数的混合专家模型,支持 1M 上下文、接受文本、图像和音频输入并输出文本,提供可控推理强度设定,并在科学推理、数学、代码、预测等任务上进行了后训练。

    Why it matters: 原文给出 Inkling 的参数规模、上下文长度和可控推理设定,开发者可据此评估它在推理深度与 token 开销之间的平衡。

  2. Hugging Face Blog65

    Thinking Machines 发布 Inkling 多模态开源模型

    Inkling 由 Thinking Machines 发布,是一个原生接收图像、文本和音频输入的大规模多模态开源模型,总参数约 1T、活跃参数 41B,支持 1M 上下文窗口。

    Why it matters: Inkling 是原生接收图音文三模态的大规模开源模型,提供 BF16 与 NVFP4 双版本及 day-0 支持的推理引擎,读者可据此评估其在多模态推理基准中的相对位置。

Jul 1Wed
  1. Google DeepMind69

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash

    Google DeepMind 发布两款生成模型,Nano Banana 2 Lite 面向高吞吐的快速出图,Gemini Omni Flash 面向高质量视频生成与对话式编辑,均已上线 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform。

    Why it matters: Nano Banana 2 Lite 每张 1K 图 0.034 美元、Omni Flash 每秒视频 0.10 美元,读者可据此比较两款模型在图像与视频环节的成本取舍。

Jun 23Tue
  1. Mistral AI64

    Mistral OCR 4 发布

    Mistral 发布 OCR 4,支持 170 种语言的单容器自托管文档解析,返回边界框、区块分类与内联置信度。

    Why it matters: 独立标注者平均 72% 偏好 OCR 4,配合单容器自托管与结构化输出,为企业 RAG 和智能体工作流提供了兼顾数据主权与提取精度的 OCR 方案。

  2. MIT News · AI62

    MIT发布Gleanmer芯片,低功耗实时3D建图助力小型机器人

    MIT研究人员发布名为Gleanmer的系统级芯片,仅消耗约6毫瓦功率即可实时构建详细3D地图,功耗仅为现有最佳建图芯片的2.5%。芯片采用高斯椭球(Gaussian)替代传统体素表示,并结合单遍生成与高斯融合算法,大幅降低内存与功耗,可帮助小型无人机在工业HVAC系统等复杂环境中避障规划路径。

    Why it matters: 算法与硬件协同设计让低功耗实时3D建图成为可能,为小型自主机器人和轻量AR设备提供了新的能效路径。

Jun 11Thu
  1. Google DeepMind64

    Google DeepMind 发布 DiffusionGemma:4 倍加速的并行扩散文本生成实验模型

    Google DeepMind 发布开源实验模型 DiffusionGemma,采用并行扩散架构替代逐 token 生成,在本地 GPU 上实现最高 4 倍推理加速。

    Why it matters: DiffusionGemma 采用并行扩散架构替代传统逐 token 生成方式,在本地 GPU 上实现最高 4 倍推理加速,为交互式本地工作流提供了新的速度方案。

Jun 9Tue
  1. Google DeepMind61

    Gemini 3.5 Live Translate:流畅自然的语音翻译

    Google DeepMind 发布 Gemini 3.5 Live Translate 音频模型,支持 70+ 语言实时语音到语音翻译,保留说话者语调与节奏。模型通过 Gemini Live API、Google Meet 和 Google Translate 开放,Android 端新增收听模式。

    Why it matters: Gemini 3.5 Live Translate支持70+语言连续翻译,保留说话者语调,开发者可通过Live API和Google Translate接入。

Jun 4Thu
  1. Ollama Blog67

    NVIDIA Nemotron 3 Ultra 模型发布

    NVIDIA Nemotron 3 Ultra 现已上线 Ollama 云端,为 550B 总参数、55B 活跃参数的开放模型,专为长程 Agent、编码 Agent 与复杂企业工作流设计,支持 1M 上下文与 NVFP4 推理。

    Why it matters: 原文给出参数规模与 NVFP4 优化,读者可据此评估它在长程 Agent 工作流中的成本与吞吐表现。

Jun 2Tue
  1. Together AI73

    MiniMax M3 发布:1M 上下文与原生多模态及高效推理实践

    MiniMax 发布 M3,Together AI 作为首选云伙伴支持其生产级部署。M3 支持 1M token 上下文、原生多模态与智能体工作流,采用 MiniMax Sparse Attention 实现 prefill 加速 9 倍、decode 加速 15 倍以上。

    Why it matters: 原文展示了稀疏注意力与多模态预处理的工程细节,读者可据此评估长上下文与多模态场景下的推理优化路径。

May 22Fri