NVIDIA Transformer Engine 加速 JAX 无丢弃 MoE 训练
summary_zh: NVIDIA Transformer Engine 为 JAX 提供加速支持,优化 MoE 模型的无丢弃训练流程。DeepSeek、Qwen、Mixtral 等 MoE 模型以条件计算实现高效训练,在较低训练算力下达到或超过稠密模型性能。
summary_zh: NVIDIA Transformer Engine 为 JAX 提供加速支持,优化 MoE 模型的无丢弃训练流程。DeepSeek、Qwen、Mixtral 等 MoE 模型以条件计算实现高效训练,在较低训练算力下达到或超过稠密模型性能。
summary_zh: DevFest 2026 将于 10 月 1 日至 12 月 31 日在全球 115 国举办超过 800 场活动,由 Google Developer Groups 社区主导。
MIT衍生公司Atlas Building Composites开发AI驱动机器人制造平台,将一次性塑料转化为房屋地基、甲板、屋架等建筑构件。其无水塑料回收技术与大型复合增材制造技术已用于支撑谷仓、码头,并近期为美国陆军工程兵团提供回收复合屋架,在马萨诸塞州湿地建造40英尺桥梁。大型复合屋架可在13分钟内打印完成,承重超过4000磅;每个Atlas工厂单元每天可生产约一栋小型房屋的结构框架材料。
MIT研究人员提出HardFlow算法,通过在生成过程末端而非中间步骤强制硬约束,使扩散模型和流匹配模型在机器人路径规划等安全关键场景中既满足严格约束又提升解质量。实验表明HardFlow在机器人操作、迷宫导航和文本引导图像编辑中实现完美约束满足,并在解质量上持续超越基线,计算时间与多数方法相当或更低。
推荐理由:该方法在部署时即可对预训练生成模型施加硬约束而不重新训练,为机器人等安全关键场景提供了可即插即用的改进路径。
Kubernetes v1.37 将原生直方图(Native Histograms)从 Alpha 升至 Beta 并默认启用,基于 Prometheus Native Histograms 提供更高精度且降低存储与抓取开销。
Hugging Face Kernels 项目正式支持 Helion,开发者可通过 kernel-builder 打包和发布 Helion 内核,用户用 get_kernel 一键加载。Helion 以
推荐理由:Helion 与 Kernels 项目整合后,开发者可一键发布可调优内核,用户免依赖地狱即可加载预调优配置。
MIT林肯实验室与麻省总医院开发的AI-GUIDE获联邦实验室联盟2026年技术转移卓越奖。该设备将AI软件与商用手持超声结合,帮助医护人员进行血管穿刺,尤其适用于战场等院前环境。已成立AutonomUS Medical Technologies推进商业化,并获得FDA突破性设备认定。
OpenAI 将 Habitat 从 Python 库演进为全球分布式存储平台,服务 10 亿 ChatGPT 用户,每秒处理 2200 万次请求。
Together AI 升级微调平台,新增 GLM-5.3、Kimi K2.7、DeepSeek-V4-Flash、Qwen 3.8-27B、Gemma 4 等开源模型支持,并引入实验实时追踪、Expert LoRA、早停、任意批量大小、样本权重、预飞行校验与打包控制等功能。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
Kubernetes v1.37 引入 InPlacePodVerticalScalingSchedulerPreemption 特性门控,允许调度器为原地扩容被 deferred 的 Pod 主动抢占同节点低优先级工作负载。原文给出从创建 kind 集群、配置 PriorityClass、触发扩容到观察 Preempted 事件的完整演示步骤。
推荐理由:原文给出了调度器主动抢占低优先级工作负载的机制,读者可以据此评估集群密度与关键服务响应性的平衡。
NVIDIA NIM 通过全栈优化在相同 GPU 基础设施上为 Nemotron 3 Ultra 多服务 2.5 倍并发用户,同时保持应用交互响应性。优化对 agentic AI 工作负载尤为重要,其提示词较长且上下文可在多步间复用。
NVIDIA BioNeMo Inference Runtime(BioIR)加速支持的生物分子结构预测模型在 NVIDIA GPU 上的推理,保留 PyTorch 工作流。它使用优化内核及适用的 CUDA Graphs 提升速度,适用于蛋白质组规模的工作流高效推进。
Mistral 与 Cloudera 达成合作,将 Mistral 模型集成进 Cloudera 混合数据平台,支持在私有云、公有云、本地及完全气隙环境部署推理并保持控制。企业还可在受控环境用专有数据训练自有模型并保留数据与智能所有权,面向主权 AI 需求。Mistral 提到 Cloudera 平台承载 30 exabytes 客户管理数据。
NVIDIA 将全球供应链绩效定义为从 wafer-out 到 first token 的两个阶段:Time-to-rack(硅片离开 fab 到系统上架)和 Time-to-token(之后的供电、散热、网络与软件栈)。文章展示如何用 Nemotron 与 Palantir Foundry 把供应链专家知识编码为可量化、可优化的流程。
OpenAI 与 GSA 将为符合条件的联邦、州、地方和部落政府提供零许可证费用、使用费五折优惠,并扩展网络安全防御支持。
PyTorch Foundation 于 9 月 8–9 日在上海举办 PyTorch Conference China 2026,与 KubeCon + CloudNativeCon 和 OpenInfra Summit 同期举行。
推荐理由:PyTorch Foundation 在中国大会公布新成员与开放 AI 栈分层,读者可据此追踪开源生态的协作版图和硬件集成进展。
Together AI 内核团队在 Vera Rubin NVL72 上扩展 ThunderKittens,支持 NVFP4 与 FP8 GEMM,并通过双 K 步长、独占张量内存、更大共享内存、B 侧收集器与 Early A release 等优化,将 NVFP4 推至超 22 PFLOPS,与 cuBLAS 和 CuTE DSL 竞争。
推荐理由:原文给出了在 Vera Rubin 上优化 NVFP4/FP8 GEMM 的具体方法与性能数据,读者可迁移这些调优思路到自家 Rubin 部署。
Hugging Face 用 Gradio Workflow 重建了 AUTOMATIC1111 的核心功能,形成包含 11 条媒体管道、73 个节点的单一工作流画布,涵盖文生图、高分辨率修复、图生图、提示词矩阵、VLM 问答、检测到 inpaint 掩码、ControlNet 风格标注器、背景去除、PNG Info 读取和图生视频。
推荐理由:原文展示了用同一套画布串联多种模型与媒体管道的构建方式,读者可据此评估 gr.Workflow 在多模态工作流中的可复用性。
Together AI 公开预览抢占式计算节点,算力与标准节点相同,按 sub-hourly 计费为按需价的 50%。回收时有 5 分钟 drain 窗口,节点标注 together.ai/compute-class=preemptible,适合可 checkpoint 或重试的短实验、推理突发和批处理任务。
推荐理由:原文给出了成本变化和开放入口,读者可以据此判断它会怎样改变现有工作流。
TRL v1.14 的 AsyncGRPOTrainer 新增 LoRA 适配器仅同步功能,结合 HF Jobs Storage Bucket 挂载,使训练与推理可运行在独立机器上,无需 NCCL。五次实验将 500 步训练从 3h27m 优化至 53min,通过 token 预算批处理和提升并发请求数将瓶颈从训练端转移到生成端。
推荐理由:通过LoRA适配器仅同步加存储桶挂载,训练与推理可部署在独立HF Jobs上无需NCCL,五次实验将500步训练从3小时27分压缩至53分钟。
GPT‑Live‑1 通过 API 推出全双工自然语音对话能力,支持更强指令遵循、自定义声音与电话渠道。开发者可借此构建更自然的语音交互应用。
Encode-prefill-decode(EPD)拆分是一种多模态模型推理优化技术,将视觉编码器阶段与 prefill 和 decode 阶段分离。该技术在图像密集型提示、短到中等长度输出以及量化 MoE 模型上效果最显著。结合 NVIDIA Dynamo 可实现最高 5 倍加速。
summary_zh: CUDA Toolkit 13.4 为 Windows on Arm 平台提供 CUDA 应用支持,此前 CUDA 仅在 Arm 平台的 Linux 上可用。
Kubernetes v1.37 新增五种 Node 生命周期条件:DrainInProgress、Drained、MaintenancePlanned、MaintenanceInProgress、GracefulNodeShutdownInProgress,为节点排水、维护和优雅关机提供统一状态通道。
Weaviate 推出 HFresh,一种面向内存敏感场景的磁盘向量索引,默认用于 Weaviate Cloud 免费档的 Cost Optimized 配置。
Together AI 发布开源 AI 栈指南,将栈分为模型、推理、网关与路由器、Harness、工具与上下文管理五层。推荐同时使用大模型(如 Kimi K3,1.8T 总参数)与小模型(如 GLM 5.3 Flash,320B 总参数)处理不同复杂度的任务,并可通过 OpenRouter、Vercel AI Gateway 或 LiteLLM 路由多提供商。
推荐理由:原文分层拆解开源 AI 栈各层组件与选型思路,开发者可按需组合模型、网关与工具。
Kubernetes v1.37 将 Workload/PodGroup API、gang scheduling 与 Workload-Aware Preemption 升级至 Beta,并引入支持多层拓扑约束与抢占策略的 CompositePodGroup API。
推荐理由:核心 WAS API 升级到 Beta 并引入 CompositePodGroup,用户可据此评估分层调度和抢占策略对分布式训练与推理工作流的影响。
summary_zh: MIT 研究员使用 GPT-5.6 Sol 配合 Codex 自主运行量子计算实验、分析结果并校准量子比特。该方案展示了 LLM 在量子实验自动化中的实际应用路径。
NVIDIA 在 2026 年 9 月宣布推进原生 Rust GPU 编程,将 CUDA Rust 成长并成熟至 2027 年及以后。CUDA C++ 与 CUDA Python 已是成熟的企业级工具链,Rust 轨道面向 AI 系统层(推理引擎、服务基础设施、驱动、Agent 运行时)的持续演进需求。
summary_zh: Foundry 将现有创意归档转换为可搜索的创意库,通过只读扫描、记录清单、准备检索记录并与 Weaviate 同步,扫描 23 个测试资产并生成 source URI。
Kubernetes v1.37 将 KubeletInUserNamespace 功能门控从 Alpha 升至 Beta,默认启用。
NVIDIA NemoClaw 被用于构建一个记忆驱动型 Chief of Staff Agent,为企业消息、决策、项目和义务等持续变化的工作提供上下文。该 Agent 维护一个可读的 self model 作为记忆层,避免每次从零重建背景。
多步推理模型此前因体积过大难以在边缘端本地运行,开发者需将推理路由至数据中心,带来网络依赖、成本与数据暴露问题。NVIDIA Jetson 现已支持部署与优化前沿推理及 Agentic AI 模型,使边缘端可直接运行多步推理,降低对数据中心的依赖。
Microsoft Agent Framework 新增 preview 集成 agent-framework-azure-cosmos-memory,通过 CosmosMemoryContextProvider 为 agent 提供跨会话持久记忆。
summary_zh: 现代 AI 平台已不再是单一登录后的应用,用户在中央门户打开受管数据集、启动笔记本并调用跨集群服务时,身份需跨越控制面与数据面边界。传统单点登录方案无法覆盖这种跨平台工作流,身份传递必须在每一步都得到保障。
Kubernetes 1.37 发布,Dynamic Resource Allocation(DRA)扩展资源支持正式稳定(GA),此前历经 KEP 接受、Alpha(1.35)、Beta(1.36)三个阶段。
summary_zh: NVIDIA PAIR Virtual Inference Router 扩展了本地网络上的可用算力。多智能体工作流中,主智能体将复杂任务拆解并分配给专用子智能体,用户可同时运行多个智能体会话。
Google DeepMind 发布 WeatherNext 3,改用实时卫星观测数据直接训练全球天气 AI 模型。模型以 5 公里分辨率、每小时更新生成预报,降水预报 CRPS 最高较 IMERG 提升 60%,并已集成至 Search、Gemini、Maps 及 Google Cloud 平台。
推荐理由:WeatherNext 3 摒弃传统数值天气预报训练数据,改为直接使用实时卫星观测数据,将全球分辨率提升至5公里并实现每小时更新,降水预报CRPS最高改善60%。
NeoMME是260M和800M多模态原生多语言编码器,单塔双向Transformer从零训练,无需独立视觉塔或因果语言模型。260M模型在ViDoRe v3上达0.523 nDCG@10,超越同参数模型,编码速度约2倍于ColModernVBERT。通过分层池化和非对称量化,late-interaction存储从1.5MB压缩至6kB/页,压缩255倍且保留95%以上检索质量。
推荐理由:单塔多模态编码器以260M参数在ViDoRe v3上超越更大模型,并通过分层池化和非对称量化将多向量检索存储压缩255倍同时保留95%以上质量。
Kubernetes v1.37 将 HPA 缩容至零功能从 Alpha 升级为 Beta 并默认启用,可基于对象指标或外部指标将工作负载缩至零再恢复。需配置外部指标适配器(如 Prometheus Adapter),并使用 ScaledToZero 状态区分自动缩容与手动暂停;升级前需确保 apiserver 与 controller-manager 均支持该功能。
推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。