Google DeepMind 发布 DiffusionGemma:4 倍加速的并行扩散文本生成实验模型
Google DeepMind 发布开源实验模型 DiffusionGemma,采用并行扩散架构替代逐 token 生成,在本地 GPU 上实现最高 4 倍推理加速。
Why it matters: DiffusionGemma 采用并行扩散架构替代传统逐 token 生成方式,在本地 GPU 上实现最高 4 倍推理加速,为交互式本地工作流提供了新的速度方案。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
Google DeepMind 发布开源实验模型 DiffusionGemma,采用并行扩散架构替代逐 token 生成,在本地 GPU 上实现最高 4 倍推理加速。
Why it matters: DiffusionGemma 采用并行扩散架构替代传统逐 token 生成方式,在本地 GPU 上实现最高 4 倍推理加速,为交互式本地工作流提供了新的速度方案。
AWS 宣布 EC2 M9g 和 M9gd 实例正式可用,首次搭载 Graviton5 处理器并配备 Nitro Isolation Engine。该组件是首个部署在商用云环境的形式化验证 Hypervisor,使用 Isabelle/HOL 完成 33 万行机器检查数学证明,涵盖保密性、完整性、功能正确性、无运行时错误和内存安全。
Why it matters: 给出了可量化的验证规模和语言选择,读者可以据此评估云虚拟机隔离的形式化保障程度。
Ollama 0.30 发布,通过 llama.cpp 增强 GGUF 兼容并保留 MLX 引擎,NVIDIA 硬件吞吐量最高提升 20%,Vulkan 默认启用以支持 AMD 与 Intel 设备。
Why it matters: Ollama 0.30 通过 GGUF 兼容与 Vulkan 默认启用扩展了硬件覆盖,读者可据此评估自身设备能否更便捷地运行更多模型。
NVIDIA Nemotron 3 Ultra 现已上线 Ollama 云端,为 550B 总参数、55B 活跃参数的开放模型,专为长程 Agent、编码 Agent 与复杂企业工作流设计,支持 1M 上下文与 NVFP4 推理。
Why it matters: 原文给出参数规模与 NVFP4 优化,读者可据此评估它在长程 Agent 工作流中的成本与吞吐表现。
Together AI 详细介绍了其生产级 ASR 栈的优化,覆盖 TensorRT 多 profile 编码器、无 CPU 同步的条件 CUDA 图解码器、共享内存与 Unix 域套接字零拷贝路径、epoll 事件驱动流式 I/O,以及 gc.freeze() 消除 p95 延迟尖峰。
Why it matters: 原文给出多层次系统优化路径,读者可据此评估自身 ASR 延迟瓶颈是否落在数据路径而非模型本身。
Amazon Science博客介绍AWS在数据中心部署的首个可扩展扁平网络RNG,采用准随机拓扑和ShuffleBox光互连设备,相比胖树架构减少69%路由器、吞吐提升33%、网络设备能耗降低40%。该网络于2024年底在爱尔兰上线,2026年4月成为AWS全球新建数据中心默认架构。
Why it matters: 提供了可量化的网络性能提升和部署数据,读者可据此评估扁平化架构在云基础设施中的实际收益。
Google Research 发布零信任聚合协议,结合格密码学单次提交与可信执行环境证明,用于 Android SafetyCore 等隐私保护场景。新协议允许设备单条消息完成加密聚合,委员会机制辅助解密并注入差分隐私噪声,同时通过 TEE 证明确保协议按公开代码正确执行。
Why it matters: 零信任架构将单次消息加密聚合与TEE证明结合,为大规模隐私分析提供了可验证的多层安全方案。
Weaviate Blog 教程演示了如何利用内嵌 MCP 的 Weaviate 构建编码助手:将代码按语法边界、文档按标题边界分块并写入 CodeChunks 与 DocChunks 两个集合。
Why it matters: 原文给出了一套可复用的 RAG 编码助手搭建流程,读者可按步骤将 Weaviate 内嵌 MCP 与 Claude Code 等客户端对接,减少上下文浪费与幻觉。
Together AI 推出面向编码智能体的规模化推理基准,测试长提示(45k–200k token)、高并发与短输出(平均 450 token)场景下的 TPM、TPS 与 p50 TTFT。
Why it matters: 原文给出了一套高并发长上下文编码智能体的基准测试方法与退化曲线,读者可据此评估自研或商用引擎在真实负载下的 TTFT 与吞吐表现。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 三款实验工具(Hypothesis Generation、Computational Discovery、Literature Insights)和桌面端 Science Skills。
Why it matters: 原文给出三款实验工具与企业预览入口,读者可据此评估自身研究工作流是否适配。
Google DeepMind与Google Research开发的AI天气模型WeatherNext在2025年10月飓风Melissa登陆牙买加前5天预测其将达到5级强度,置信度80%,3天前升至近100%。
Why it matters: WeatherNext在飓风Melissa登陆前5天以80%置信度预测出5级强度,为防灾争取了关键准备时间。
Kubernetes v1.36 将 Workload API 改为静态模板,并引入独立的 PodGroup API 与专用的 PodGroup 调度周期,实现原子级工作负载调度。同时推出拓扑感知调度、工作负载感知抢占、PodGroup 的 DRA ResourceClaim 支持,以及 Job 控制器与新一代 API 的首批集成。所有功能均以 Alpha 特性提供,需启用对应的功能开关。
Why it matters: 原文给出了架构升级和多项新功能,读者可以据此评估它对大规模 AI 训练与批处理工作流的实际影响。
Kubernetes v1.36 将节点、Pod 和容器层级的 PSI 压力指标升级为稳定可用(GA),不再需要功能门控。Kubelet 会先检测内核是否支持 PSI 再上报,避免旧版本在内核未启用时输出误导性零值。
Why it matters: 原文给出资源占用实测数据,读者可据此判断在生产集群启用 PSI 监控的额外开销是否在可接受范围内。
DeepSeek-V4 支持 1M 上下文窗口,通过 CSA/HCA/SWA 混合注意力在 token 轴压缩 KV 缓存。在 NVIDIA HGX B200 上,缓存策略使单节点 KV 容量从约 1.2M token 提升至 3.7M token。
Why it matters: V4 把百万上下文变成系统问题,读者可据此判断自身负载是否落在压缩注意力与缓存策略的有效区间。
Kubernetes v1.36 引入 manifest-based admission control alpha 特性,允许通过 API server 启动时加载磁盘上的策略文件,在集群引导阶段即生效并防止被删除。
Why it matters: 原文给出了 manifest-based admission control 的启动加载机制和保护边界,读者可以据此评估它对集群引导阶段安全策略可用性的实际改善。
DeepSeek-V4 Pro 已在 Together AI 提供 Serverless Inference,模型级支持 1M 上下文,当前部署窗口为 512K,采用 1.6T 参数 MoE 架构,激活 49B 参数。提供 Non-Think、Think High、Think Max 三档推理模式,并针对重复长上下文给出缓存输入定价($0.20 / 1M tokens)。
Why it matters: 原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
NVIDIA Nemotron 3 Nano Omni 现已上线 Together AI 平台,这是一款支持视频、图像、音频和语言的多模态开放模型。其 30B A3B MoE 架构每次激活约 3B 参数,支持最多 256K tokens 的共享多模态上下文,并在单一推理循环中完成跨模态推理。
Why it matters: 单一模型统一多模态推理降低了多模型拼接的复杂度,对构建多模态智能体系统的开发者具有直接参考价值。
Weaviate v1.37 已开源并上线 Weaviate Cloud,新增 MCP Server(预览)、可扩展分词器、MMR 多样性搜索、查询性能分析、增量备份、Gemini 音频支持和 BlobHash 属性类型。
Why it matters: 内置 MCP Server 让数据库原生接入 Agent 工具链,增量备份和 BlobHash 则直接降低大规模运维成本。
Mistral AI 发布 Spaces CLI,为人类开发者和 AI 智能体提供统一命令行接口。文章提出交互输入应有 flag 等价、状态显式化、插件可自省等原则,并指出生成 context.json 和 AGENTS.md 可显著减少智能体错误。从单提示到部署上线仅需不到 10 分钟。
Why it matters: 原文系统阐述了让 CLI 同时服务人类与 AI 智能体的设计原则,涵盖 flag 等价、显式状态、插件化等模式,读者可据此构建更可组合、可脚本化的开发者工具。
Ollama 0.19 预览版在 Apple Silicon 上基于 MLX 框架加速,M5/M5 Pro/M5 Max 利用新 GPU 神经加速器提升 TTFT 和生成速度。引入 NVIDIA NVFP4 格式支持,并升级缓存以提高响应效率。
Why it matters: Apple Silicon 上运行 Ollama 的速度变化和 NVFP4 支持,可帮助用户评估本地推理的性能边界。