AWS数据中心网络用扁平化架构替代胖树架构
Amazon Science博客介绍AWS在数据中心部署的首个可扩展扁平网络RNG,采用准随机拓扑和ShuffleBox光互连设备,相比胖树架构减少69%路由器、吞吐提升33%、网络设备能耗降低40%。该网络于2024年底在爱尔兰上线,2026年4月成为AWS全球新建数据中心默认架构。
推荐理由:提供了可量化的网络性能提升和部署数据,读者可据此评估扁平化架构在云基础设施中的实际收益。
Amazon Science博客介绍AWS在数据中心部署的首个可扩展扁平网络RNG,采用准随机拓扑和ShuffleBox光互连设备,相比胖树架构减少69%路由器、吞吐提升33%、网络设备能耗降低40%。该网络于2024年底在爱尔兰上线,2026年4月成为AWS全球新建数据中心默认架构。
推荐理由:提供了可量化的网络性能提升和部署数据,读者可据此评估扁平化架构在云基础设施中的实际收益。
Google Research 发布零信任聚合协议,结合格密码学单次提交与可信执行环境证明,用于 Android SafetyCore 等隐私保护场景。新协议允许设备单条消息完成加密聚合,委员会机制辅助解密并注入差分隐私噪声,同时通过 TEE 证明确保协议按公开代码正确执行。
推荐理由:零信任架构将单次消息加密聚合与TEE证明结合,为大规模隐私分析提供了可验证的多层安全方案。
Mistral 发布 physics AI,将工程仿真从数小时/周缩短到秒级单 GPU 前向传播。整合 Emmi AI 作为企业解决方案中新基础能力,合作伙伴包括 ASML、Airbus、Safran 和 Siemens Energy。覆盖产品设计、工装工艺设计和实时数字孪生三大场景,不是替代传统求解器,而是大幅提升设计迭代吞吐量。
Mistral 收购 Emmi AI,宣布加码 Physics AI,覆盖航空航天、汽车、半导体与能源领域。已发布多项突破,包括 3D 机翼跨声速 CFD 数据集、GyroSwin 5D 代理模型、AB-UPT 支持 140M 体素单 GPU 推理,以及 NeuralDEM 端到端多物理场代理模型,部分成果已开源。
Google在Nature发表ERA论文并将其作为工具开放,ERA使用Gemini通过树搜索优化科学代码,在基因组学、公共卫生等六类基准上达到专家级性能。ERA已应用于八个科学问题的研究中,涵盖流行病预测、CO2监测、径流预报、太阳能优化和零售预测,并作为Computational Discovery的核心组件通过Gemini for Science逐步开放。
summary_zh: Vector Institute 发布 Health AI Implementation Toolkit v2.0,提供五阶段框架帮助医疗系统领导者、AI 供应商和临床团队安全负责任地部署 AI。
Together AI 推出面向编码智能体的规模化推理基准,测试长提示(45k–200k token)、高并发与短输出(平均 450 token)场景下的 TPM、TPS 与 p50 TTFT。
推荐理由:原文给出了一套高并发长上下文编码智能体的基准测试方法与退化曲线,读者可据此评估自研或商用引擎在真实负载下的 TTFT 与吞吐表现。
Google DeepMind 发布 Gemini for Science,包含 Google Labs 三款实验工具(Hypothesis Generation、Computational Discovery、Literature Insights)和桌面端 Science Skills。
推荐理由:原文给出三款实验工具与企业预览入口,读者可据此评估自身研究工作流是否适配。
Google DeepMind与Google Research开发的AI天气模型WeatherNext在2025年10月飓风Melissa登陆牙买加前5天预测其将达到5级强度,置信度80%,3天前升至近100%。
推荐理由:WeatherNext在飓风Melissa登陆前5天以80%置信度预测出5级强度,为防灾争取了关键准备时间。
Kubernetes 1.36 将 Mixed Version Proxy(MVP)从 Alpha 升级为 Beta 并默认启用,解决集群升级期间旧 API server 对新资源返回 404 的问题。
Together AI 与 Pearl Research Labs 合作推出 Gemma-4-31B-it-pearl 推理端点,价格折扣超 25%,由 Pearl 加密货币收益对冲。Pearl Network 通过 Proof of Useful Work 在推理和训练过程中并行生成 ¶PRL 代币,降低 LLM 每 token 价格。
summary_zh: Weaviate v1.37 将分词器变为可观测且多语言友好的数据库组件。文章覆盖混合搜索基础、四种分词方法(word/lowercase/whitespace/field)、重音折叠以解决多语言搜索失配,以及按属性配置停用词和 tokenize 接口验证。
Kubernetes v1.36 将 Workload API 改为静态模板,并引入独立的 PodGroup API 与专用的 PodGroup 调度周期,实现原子级工作负载调度。同时推出拓扑感知调度、工作负载感知抢占、PodGroup 的 DRA ResourceClaim 支持,以及 Job 控制器与新一代 API 的首批集成。所有功能均以 Alpha 特性提供,需启用对应的功能开关。
推荐理由:原文给出了架构升级和多项新功能,读者可以据此评估它对大规模 AI 训练与批处理工作流的实际影响。
Kubernetes v1.36 将节点、Pod 和容器层级的 PSI 压力指标升级为稳定可用(GA),不再需要功能门控。Kubelet 会先检测内核是否支持 PSI 再上报,避免旧版本在内核未启用时输出误导性零值。
推荐理由:原文给出资源占用实测数据,读者可据此判断在生产集群启用 PSI 监控的额外开销是否在可接受范围内。
DeepSeek-V4 支持 1M 上下文窗口,通过 CSA/HCA/SWA 混合注意力在 token 轴压缩 KV 缓存。在 NVIDIA HGX B200 上,缓存策略使单节点 KV 容量从约 1.2M token 提升至 3.7M token。
推荐理由:V4 把百万上下文变成系统问题,读者可据此判断自身负载是否落在压缩注意力与缓存策略的有效区间。
summary_zh: 使用 Goose CLI Agent 配合 Together 的 dedicated containers skill,从 HuggingFace 拉取 Netflix 刚发布的 void-model,在单次会话内完成容器配置并部署到 Together DCI 基础设施,实现发布当天即可运行。
Kubernetes v1.36 发布 Dynamic Resource Allocation(DRA)更新,带来多项功能毕业、新增能力与驱动扩展。
Kubernetes v1.36 引入服务端分片 List 和 Watch(KEP-5866),API server 按 hash 范围过滤事件,每个控制器副本只接收所属分片。
Kubernetes v1.36 中原生类型的声明式验证(Declarative Validation)达到 GA,DeclarativeValidation 功能门控默认启用。
Kubernetes v1.36 引入 manifest-based admission control alpha 特性,允许通过 API server 启动时加载磁盘上的策略文件,在集群引导阶段即生效并防止被删除。
推荐理由:原文给出了 manifest-based admission control 的启动加载机制和保护边界,读者可以据此评估它对集群引导阶段安全策略可用性的实际改善。
Together AI 在 NVIDIA GTC 2026 分享其生产级推理优化体系,涵盖 FlashAttention-4、ThunderKittens 及开源自适应推测解码系统 Aurora(最高加速 1.25x)。
Kubernetes v1.36 引入 Pod-Level Resource Managers(Alpha),将 Topology、CPU 与 Memory 管理器从容器级分配扩展为 Pod 级资源预算与 NUMA 对齐。
summary_zh: Google Research 强调开源软件与开放数据集是现代科学的驱动力,通过与 UCSC Genomics Institute、Janelia、ISTA、CSIRO、AIIMS 及 Human Pangenome Research Consortium 等机构合作推动科学进步。
Kubernetes v1.36 中 In-Place Pod-Level Resources Vertical Scaling 毕业进入 Beta,通过 InPlacePodLevelResourcesVerticalScaling 功能门控默认启用,允许用户在线调整 Pod 的聚合资源预算,通常无需重启容器。
Kubernetes v1.36 引入 Memory QoS 的 TieredReservation 策略,按 Pod 的 QoS 等级提供分层内存保护:Guaranteed Pod 通过 memory.min 获得硬保护,Burstable Pod 通过 memory.low 获得软保护,BestEffort Pod 不设保护。
DeepSeek-V4 Pro 已在 Together AI 提供 Serverless Inference,模型级支持 1M 上下文,当前部署窗口为 512K,采用 1.6T 参数 MoE 架构,激活 49B 参数。提供 Non-Think、Think High、Think Max 三档推理模式,并针对重复长上下文给出缓存输入定价($0.20 / 1M tokens)。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Kubernetes v1.36 通过 client-go 的 AtomicFIFO 特性与 ConsistencyStore 接口缓解控制器缓存陈旧问题,并在 kube-controller-manager 中默认启用 DaemonSet、StatefulSet、ReplicaSet、Job 四类控制器的陈旧一致性检查。
NVIDIA Nemotron 3 Nano Omni 现已上线 Together AI 平台,这是一款支持视频、图像、音频和语言的多模态开放模型。其 30B A3B MoE 架构每次激活约 3B 参数,支持最多 256K tokens 的共享多模态上下文,并在单一推理循环中完成跨模态推理。
推荐理由:单一模型统一多模态推理降低了多模型拼接的复杂度,对构建多模态智能体系统的开发者具有直接参考价值。
Kubernetes v1.36 将暂停 Job 的 Pod 资源可变功能从 alpha 升级为 beta,MutablePodResourcesForSuspendedJobs 功能开关默认启用。
Mistral AI 发布 Workflows 进入公开预览,这是面向企业 AI 的编排层,基于 Temporal 引擎提供容错执行、可观测性与人工审批。开发者用 Python 编写工作流,通过 Le Chat 触发,Studio 记录全量执行轨迹;控制平面在 Mistral,Worker 部署在用户自有 Kubernetes 环境,支持云、本地或混合部署。
Weaviate v1.37 已开源并上线云服务,新增 MCP Server、可扩展分词器、MMR 多样性搜索、查询性能分析、增量备份、Gemini 音频支持和 BlobHash 属性类型。MCP Server 让 LLM 和 IDE 可原生对接数据库;增量备份通过引用未变更数据块缩小备份体积;BlobHash 在向量化后仅持久化 SHA-256 哈希。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Google DeepMind 提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为异步计算岛以隔离硬件故障。实验表明,该架构在 2-5 Gbps 广域网上训练 120 亿参数模型,性能与传统方法持平且速度快 20 倍以上,并能混合不同代 TPU 硬件。
Google Research提出ReasoningBank框架,使智能体能从成功与失败经验中蒸馏推理模式并实现测试时自我进化。在WebArena和SWE-Bench-Verified上,基于Gemini-2.5-Flash的ReasoningBank相比无记忆基线分别提升8.3%和4.6%成功率。MaTTS通过并行与串行缩放进一步增强学习效果。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,帮助各行业大规模采用前沿 AI。
summary_zh: 多租户 GPU 集群让多个团队共享同一硬件,通过硬配额、预订窗口和调度护栏实现租户隔离,防止跨团队资源争抢。平台需提供 pooled capacity、tenant isolation 和 self-serve access 三项核心能力,并支持按租户实际用量直接计费。
summary_zh: AI Native Cloud 是为 AI 原生公司量身打造的新一代云基础设施,覆盖从预训练、微调到推理的完整生命周期。它以 GPU 加速、NVLink/RDMA 高速互联和统一软件栈为核心,强调研究到生产的快速转化、推理速度与成本优化,以及可按需扩展的 GPU 集群能力。
Together AI 的内核团队在 2022 年阵亡将士纪念日假期发布 FlashAttention,实现 2–3 倍加速。2025 年 3 月团队约 15 人,用一周时间基于 ThunderKittens 在 Blackwell 上开发出比 cuBLAS 快 2 倍的 FP4/FP8 GEMM 内核。团队采用学术与产业协同模式,成员来自 UCSD、普林斯顿、Caltech 等。
Mistral AI 发布 Spaces CLI,为人类开发者和 AI 智能体提供统一命令行接口。文章提出交互输入应有 flag 等价、状态显式化、插件可自省等原则,并指出生成 context.json 和 AGENTS.md 可显著减少智能体错误。从单提示到部署上线仅需不到 10 分钟。
推荐理由:原文系统阐述了让 CLI 同时服务人类与 AI 智能体的设计原则,涵盖 flag 等价、显式状态、插件化等模式,读者可据此构建更可组合、可脚本化的开发者工具。
Ollama 0.19 预览版在 Apple Silicon 上基于 MLX 框架加速,M5/M5 Pro/M5 Max 利用新 GPU 神经加速器提升 TTFT 和生成速度。引入 NVIDIA NVFP4 格式支持,并升级缓存以提高响应效率。
推荐理由:Apple Silicon 上运行 Ollama 的速度变化和 NVFP4 支持,可帮助用户评估本地推理的性能边界。
Google Research 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示转为具备物理感知的可运行 Android XR 应用,整个过程不到 60 秒。
推荐理由:原文给出了从自然语言到可运行 Android XR 应用的端到端流程与实测基线,读者可据此判断自身原型开发是否值得接入。