跳到正文

#模型发布

今日 7 条
今天9月30日周三
  1. AWS Machine Learning Blog59

    GPT-6.1 Sol 在 Amazon Bedrock 上正式可用,为智能体工作流带来接近 Astra 的推理能力

    GPT-6.1 Sol 现已在 Amazon Bedrock 上正式可用,据 OpenAI 称其以约 GPT-6 Astra 五分之一的成本在 DeepSWE v1.1 上达到相近推理水平。它同时在多步工作流、复杂文档分析和透明度评估上优于前代 GPT-6 Sol,并可通过 Codex、ChatGPT Work 及 Bedrock API 应用于编码、文档处理和跨系统协调场景。

  2. Digital Trends · AI82

    OpenAI 发布 GPT-6.1 Sol,编码与科学推理接近 Astra 但成本约五分之一

    OpenAI 在撤回 GPT-6.1 Astra 后发布 GPT-6.1 Sol,宣称在编码、计算机使用、专业与科学任务上接近 Astra。DeepSWE 上 Sol 匹配 Astra 且成本约五分之一,OSWorld 2.0 离线集接近 Astra,Terminal-Bench Science 0.1 得分翻倍但 Astra 仍领先。

    推荐理由:原文给出具体测试分数与单价对比,读者可据此评估 Sol 在成本与能力之间是否值得替代 Astra。

  3. Hugging Face Blog62

    NVIDIA Kumo Tabular 设定表格预测准确-效率新前沿

    NVIDIA发布开源表格预测基础模型Kumo Tabular,单次前向传播即可预测,无需训练或调优。在TabArena等四个基准上排名第一,28M至215M参数规模下准确-效率达前沿,比LimiX-2快17倍。模型基于Transformer仅在人工数据上预训练,以OpenMDW-1.1许可证商业可用。

    推荐理由:表格预测长期依赖梯度提升树,Kumo Tabular以单次前向传播提供无需训练与调优的预测且在TabArena等基准排名第一。

9月29日周二
  1. The Decoder79

    ElevenLabs 发布 v4 语音模型,AI 声音更具表现力且更一致

    ElevenLabs 发布 v4 语音模型,新架构提升方向遵循与长内容声音一致性,支持 90+ 语言及原生口音克隆。Turbo 变体实现 150 毫秒语音启动,在 Artificial Analysis 发音基准测试中得分 91.7%,盲测中约四分之三听众更偏好 v4。标准版 API 定价 $80/百万字符,Turbo 版 $40,即日起至 10 月 12 日临时降价至 $22 和 $11。

    推荐理由:新版本在发音基准测试中得分91.7%,Turbo变体可在150毫秒内开始语音生成,为实时语音代理提供了速度与表达兼顾的方案。

  2. Ben's Bites · News52

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布 Claude Sonnet 5.5,编码能力接近 Opus 5.5,图像与图表理解有显著提升。作者建议 $20 计划用户在高思考模式下用 Sonnet 5.5 替代部分 Opus 请求,并提到 Anthropic 的 .5 版本 Sonnet 历来表现较好。

  3. 爱范儿72

    Space Bunny Alpha 能用涂鸦做网站和3D游戏

    Space Bunny Alpha 在 OpenRouter 和 OpenCode 上线后冲上日调用量第一,响应快、长上下文稳定、编码和 Agent 表现好。测试中它能把涂鸦草图转为可交互网站,并实现喷墨占地小游戏和液氧甲烷发动机剖视展品;与 Opus 5.5、GPT-6 Astra 等相比,细节和复杂运动仍有差距。推测与 MiniMax M3.1 同源,目前免费调用。

  4. Simon Willison62

    Anthropic 发布 Claude Sonnet 5.5

    Anthropic 发布 Claude Sonnet 5.5,称其运行速度快 30% 以上、多数任务成本最多降低 30%,定价与 Sonnet 5 相同。该模型现用于 claude.ai 免费层,Simon Willison 实测它在部分编码任务上接近 Opus 5.5。Anthropic 同时表示 Haiku 5.5 将在未来几周内推出。

9月28日周一
9月24日周四
9月23日周三
  1. Latent Space91

    Claude Opus 5.5 发布,定价降 40% 并成为 AINews 默认模型

    Anthropic 发布 Claude Opus 5.5,号称多数任务达到 Fable 5.1 水平,运行成本较 Opus 5 降低 40%,并成为 Claude Code 与 Claude 应用默认模型。OpenAI 随后发布 GPT-6 Sol 与 Luna,定价约为前代一半。Opus 5.5 在 Agentic 编码、OSWorld 等基准领先,但缓存读取与用量变化使实际节省取决于使用方式。

    推荐理由:Anthropic 强调写作改进与多智能体扩展,读者可据此判断 Opus 5.5 是否值得替代现有工作流。

  2. AWS Machine Learning Blog69

    GPT-6 Sol 与 GPT-6 Luna 在 Amazon Bedrock 正式可用

    GPT-6 Sol 与 GPT-6 Luna 已在 Amazon Bedrock 正式可用,两款模型的 API 定价均显著低于 GPT-5.6 前代。GPT-6 Sol 面向每周重复出现的复杂编码与运维任务,OpenAI 内部事实性评测显示其事实性错误约为 GPT-5.6 Sol 的一半;GPT-6 Luna 面向高并发的信息提取、摘要、分类和聚焦问答,可逐请求调整推理强度。

    推荐理由:原文对比了 GPT-6 Sol 与 Luna 在 Bedrock 上的定位和定价,给出按任务分层选型与提示词缓存的实践参考。

9月22日周二
9月16日周三
9月10日周四
9月9日周三
9月8日周二
  1. Interconnects60

    最新开源模型与许可证动态:Motif-3、GLM-5.3、Hy4-preview 及开放许可证趋势

    Interconnects 汇总了最新开源模型与许可证动态:Motif-3 采用 MIT 许可证并以有限资源取得亮眼成绩;GLM-5.3 从 MIT 转为自定义许可证,对推理与微调服务设置 100 亿美元营收门槛及安全审查;Hy4-preview 延续了腾讯模型迭代路径但存在过度思考问题;Qwen3.8-Flash-Next 展示了 125B-A6B 架构与 GDN 等新技术。

  2. Google DeepMind71

    Google DeepMind 发布 AlphaGenome Atlas:人类基因组中每种可能 DNA 字母变化的预测地图

    Google DeepMind 发布了 AlphaGenome Atlas,提供人类基因组中 90 亿个单核苷酸变异的分子影响预测。该平台包含数千个分子效应预测,覆盖多个细胞类型,已在罕见病研究中验证变异功能。AlphaGenome Atlas 通过网站、AlphaGenome API 和 Google Antigravity 提供。

    推荐理由:Google DeepMind 发布了 AlphaGenome Atlas,提供人类基因组中 90 亿个单核苷酸变异的分子影响预测,并推出 AVI 分数用于变异影响评估。

9月3日周四
  1. Google DeepMind65

    Google DeepMind 发布 WeatherNext 3,全球天气 AI 模型分辨率提升至 5 公里并实现每小时更新

    Google DeepMind 发布 WeatherNext 3,改用实时卫星观测数据直接训练全球天气 AI 模型。模型以 5 公里分辨率、每小时更新生成预报,降水预报 CRPS 最高较 IMERG 提升 60%,并已集成至 Search、Gemini、Maps 及 Google Cloud 平台。

    推荐理由:WeatherNext 3 摒弃传统数值天气预报训练数据,改为直接使用实时卫星观测数据,将全球分辨率提升至5公里并实现每小时更新,降水预报CRPS最高改善60%。

  2. Hugging Face Blog61

    NeoMME高效多模态原生多语言编码器

    NeoMME是260M和800M多模态原生多语言编码器,单塔双向Transformer从零训练,无需独立视觉塔或因果语言模型。260M模型在ViDoRe v3上达0.523 nDCG@10,超越同参数模型,编码速度约2倍于ColModernVBERT。通过分层池化和非对称量化,late-interaction存储从1.5MB压缩至6kB/页,压缩255倍且保留95%以上检索质量。

    推荐理由:单塔多模态编码器以260M参数在ViDoRe v3上超越更大模型,并通过分层池化和非对称量化将多向量检索存储压缩255倍同时保留95%以上质量。

  3. Google DeepMind70

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,前者延续 3.7 Flash 的速度与定价(每百万输入 token 0.75 美元、每百万输出 token 3.75 美元),在软件工程、智能体任务和多步推理上明显提升。

    推荐理由:3.8 Flash 在相同价格下把提升集中在长周期编码与智能体任务,读者可据此判断是否替换现有生产模型。