Skip to content

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

101 selectedRelated topics产品更新论文研究开源生态

Latest selected

41–60 of 101
Sep 23Wed
  1. Latent Space91

    Claude Opus 5.5 发布,定价降 40% 并成为 AINews 默认模型

    Anthropic 发布 Claude Opus 5.5,号称多数任务达到 Fable 5.1 水平,运行成本较 Opus 5 降低 40%,并成为 Claude Code 与 Claude 应用默认模型。OpenAI 随后发布 GPT-6 Sol 与 Luna,定价约为前代一半。Opus 5.5 在 Agentic 编码、OSWorld 等基准领先,但缓存读取与用量变化使实际节省取决于使用方式。

    Why it matters: Anthropic 强调写作改进与多智能体扩展,读者可据此判断 Opus 5.5 是否值得替代现有工作流。

  2. AWS Machine Learning Blog69

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    GPT-6 Sol 与 GPT-6 Luna 已在 Amazon Bedrock 正式可用,两款模型的 API 定价均显著低于 GPT-5.6 前代。GPT-6 Sol 面向每周重复出现的复杂编码与运维任务,OpenAI 内部事实性评测显示其事实性错误约为 GPT-5.6 Sol 的一半;GPT-6 Luna 面向高并发的信息提取、摘要、分类和聚焦问答,可逐请求调整推理强度。

    Why it matters: 原文对比了 GPT-6 Sol 与 Luna 在 Bedrock 上的定位和定价,给出按任务分层选型与提示词缓存的实践参考。

Sep 22Tue
Sep 17Thu
  1. PyTorch Blog67

    PyTorch Blog:Low Precision Flash Attention 4 支持MXFP8前向与反向

    PyTorch Blog发布Low Precision Flash Attention 4,在Blackwell上扩展MXFP8前向与反向,前向达2.85 PF/s、反向达2 PF/s,LLM形状较BF16加速1.6×和1.52×。代码已开源至ads_model_kernel_library/lp_fa4。

    Why it matters: 原文给出了MXFP8前向与反向的PFLOP/s数据及开源地址,读者可据此评估Blackwell训练栈的实际加速效果。

Sep 16Wed
Sep 10Thu
Sep 8Tue
  1. Google DeepMind71

    Google DeepMind 发布 AlphaGenome Atlas:人类基因组中每种可能 DNA 字母变化的预测地图

    Google DeepMind 发布了 AlphaGenome Atlas,提供人类基因组中 90 亿个单核苷酸变异的分子影响预测。该平台包含数千个分子效应预测,覆盖多个细胞类型,已在罕见病研究中验证变异功能。AlphaGenome Atlas 通过网站、AlphaGenome API 和 Google Antigravity 提供。

    Why it matters: Google DeepMind 发布了 AlphaGenome Atlas,提供人类基因组中 90 亿个单核苷酸变异的分子影响预测,并推出 AVI 分数用于变异影响评估。

Sep 3Thu
  1. Google DeepMind65

    Google DeepMind 发布 WeatherNext 3,全球天气 AI 模型分辨率提升至 5 公里并实现每小时更新

    Google DeepMind 发布 WeatherNext 3,改用实时卫星观测数据直接训练全球天气 AI 模型。模型以 5 公里分辨率、每小时更新生成预报,降水预报 CRPS 最高较 IMERG 提升 60%,并已集成至 Search、Gemini、Maps 及 Google Cloud 平台。

    Why it matters: WeatherNext 3 摒弃传统数值天气预报训练数据,改为直接使用实时卫星观测数据,将全球分辨率提升至5公里并实现每小时更新,降水预报CRPS最高改善60%。

  2. Hugging Face Blog61

    NeoMME高效多模态原生多语言编码器

    NeoMME是260M和800M多模态原生多语言编码器,单塔双向Transformer从零训练,无需独立视觉塔或因果语言模型。260M模型在ViDoRe v3上达0.523 nDCG@10,超越同参数模型,编码速度约2倍于ColModernVBERT。通过分层池化和非对称量化,late-interaction存储从1.5MB压缩至6kB/页,压缩255倍且保留95%以上检索质量。

    Why it matters: 单塔多模态编码器以260M参数在ViDoRe v3上超越更大模型,并通过分层池化和非对称量化将多向量检索存储压缩255倍同时保留95%以上质量。

  3. Google DeepMind70

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者延续 3.7 Flash 的速度与定价(每百万输入 token 0.75 美元、每百万输出 token 3.75 美元),在软件工程、智能体任务和多步推理上明显提升。

    Why it matters: 3.8 Flash 在相同价格下把提升集中在长周期编码与智能体任务,读者可据此判断是否替换现有生产模型。

Sep 1Tue
  1. Google Research62

    Google 发布 TimesFM-3,支持多变量零样本时间序列预测

    Google Research 发布 TimesFM-3 时间序列基础模型,参数量 330M,预训练语料超过 1 万亿个时间点,原生支持多变量预测。模型可在单次前向传播中联合预测多条相关序列并输出 9 个分位数,同时支持历史协变量与已知未来协变量,无需任务级微调。

    Why it matters: 相比前代只做单变量预测,TimesFM-3 原生支持多变量与协变量输入,可用于零售、金融等实际预测任务。

Aug 28Fri
Aug 27Thu
Aug 15Sat
  1. Interconnects82

    GLM-5.3:Z.ai 发布新模型,参数更少但编码基准表现逼近前沿

    Z.ai 发布 GLM-5.3,目前仅在编码计划中可用,两周后开放权重并上线 Hugging Face。该模型在多个基准上超越 Kimi K3、Claude Fable 5 和 GPT-5.6-Sol,参数量仅约 750B,约为 Kimi K3 的三分之一。

    Why it matters: 在参数规模明显更小的情况下,GLM-5.3 在智能体编码基准上逼近前沿,读者可借此观察中国实验室的训练策略与美国厂商的发布节奏差异。

Aug 14Fri
  1. Hugging Face Blog75

    开源模型半年观察:前沿迁移、采纳现实与Agent成为主要用户

    Hugging Face 发布 2026 年上半年开源模型观察报告,指出中国实验室在几乎每个月的前沿模型规模都超过美国模型,同时 Qwen 衍生模型达 15 万个、成为社区基础模型。下载量高度集中于小模型,GGUF 等本地推理格式增长远超模型仓库本身增速。Agent 首次成为 Hub 主要流量来源,7 月 Claude Code 占 44.4%,近四分之一流量来自未注册客户端。

    Why it matters: 报告揭示了开源模型格局的前沿迁移与采纳现实之间的落差,为观察中国实验室的发布策略与社区实际依赖提供了可对照的数据视角。

Aug 11Tue
  1. Ollama Blog76

    NVIDIA Nemotron 3.5 Lightning 模型发布

    NVIDIA Nemotron 3.5 Lightning 现已上线 Ollama,30B 总参数、每 token 仅 3B 活跃参数,基于混合专家架构,专为本地 Agent 设计。模型支持 1M 上下文、推测解码多令牌预测,经称可达 4 倍吞吐量与 30% 更快任务完成时间,权重与数据集均开源,可在 RTX PC、工作站、DGX Spark / Station 及云端运行。

    Why it matters: 开源本地 Agent 模型兼顾 3B 活跃参数与 1M 上下文,读者可据此评估在 RTX 设备上跑高吞吐多步任务的可行性。