跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 61–80 条 · 共 85 条
6月23日周二
  1. MIT News · AI62

    MIT发布Gleanmer芯片,低功耗实时3D建图助力小型机器人

    MIT研究人员发布名为Gleanmer的系统级芯片,仅消耗约6毫瓦功率即可实时构建详细3D地图,功耗仅为现有最佳建图芯片的2.5%。芯片采用高斯椭球(Gaussian)替代传统体素表示,并结合单遍生成与高斯融合算法,大幅降低内存与功耗,可帮助小型无人机在工业HVAC系统等复杂环境中避障规划路径。

    推荐理由:算法与硬件协同设计让低功耗实时3D建图成为可能,为小型自主机器人和轻量AR设备提供了新的能效路径。

6月11日周四
  1. Google DeepMind64

    Google DeepMind 发布 DiffusionGemma:4 倍加速的并行扩散文本生成实验模型

    Google DeepMind 发布开源实验模型 DiffusionGemma,采用并行扩散架构替代逐 token 生成,在本地 GPU 上实现最高 4 倍推理加速。

    推荐理由:DiffusionGemma 采用并行扩散架构替代传统逐 token 生成方式,在本地 GPU 上实现最高 4 倍推理加速,为交互式本地工作流提供了新的速度方案。

6月10日周三
  1. Amazon Science76

    AWS EC2 M9g 实例推出经形式化验证的隔离引擎

    AWS 宣布 EC2 M9g 和 M9gd 实例正式可用,首次搭载 Graviton5 处理器并配备 Nitro Isolation Engine。该组件是首个部署在商用云环境的形式化验证 Hypervisor,使用 Isabelle/HOL 完成 33 万行机器检查数学证明,涵盖保密性、完整性、功能正确性、无运行时错误和内存安全。

    推荐理由:给出了可量化的验证规模和语言选择,读者可以据此评估云虚拟机隔离的形式化保障程度。

5月29日周五
  1. Together AI78

    Together AI 构建最快语音转文本栈的方法

    Together AI 详细介绍了其生产级 ASR 栈的优化,覆盖 TensorRT 多 profile 编码器、无 CPU 同步的条件 CUDA 图解码器、共享内存与 Unix 域套接字零拷贝路径、epoll 事件驱动流式 I/O,以及 gc.freeze() 消除 p95 延迟尖峰。

    推荐理由:原文给出多层次系统优化路径,读者可据此评估自身 ASR 延迟瓶颈是否落在数据路径而非模型本身。

5月28日周四
  1. Amazon Science79

    AWS数据中心网络用扁平化架构替代胖树架构

    Amazon Science博客介绍AWS在数据中心部署的首个可扩展扁平网络RNG,采用准随机拓扑和ShuffleBox光互连设备,相比胖树架构减少69%路由器、吞吐提升33%、网络设备能耗降低40%。该网络于2024年底在爱尔兰上线,2026年4月成为AWS全球新建数据中心默认架构。

    推荐理由:提供了可量化的网络性能提升和部署数据,读者可据此评估扁平化架构在云基础设施中的实际收益。

  2. Google Research62

    Google Research 提出零信任聚合实现隐私分析

    Google Research 发布零信任聚合协议,结合格密码学单次提交与可信执行环境证明,用于 Android SafetyCore 等隐私保护场景。新协议允许设备单条消息完成加密聚合,委员会机制辅助解密并注入差分隐私噪声,同时通过 TEE 证明确保协议按公开代码正确执行。

    推荐理由:零信任架构将单次消息加密聚合与TEE证明结合,为大规模隐私分析提供了可验证的多层安全方案。

5月19日周二
  1. Together AI73

    Together AI 发布编码智能体推理基准测试

    Together AI 推出面向编码智能体的规模化推理基准,测试长提示(45k–200k token)、高并发与短输出(平均 450 token)场景下的 TPM、TPS 与 p50 TTFT。

    推荐理由:原文给出了一套高并发长上下文编码智能体的基准测试方法与退化曲线,读者可据此评估自研或商用引擎在真实负载下的 TTFT 与吞吐表现。

5月17日周日
5月16日周六
5月11日周一
4月29日周三
  1. Together AI72

    DeepSeek-V4 Pro 现已在 Together AI 上可用

    DeepSeek-V4 Pro 已在 Together AI 提供 Serverless Inference,模型级支持 1M 上下文,当前部署窗口为 512K,采用 1.6T 参数 MoE 架构,激活 49B 参数。提供 Non-Think、Think High、Think Max 三档推理模式,并针对重复长上下文给出缓存输入定价($0.20 / 1M tokens)。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

4月28日周二
  1. Together AI60

    Together AI 在 Day 0 推出 NVIDIA Nemotron 3 Nano Omni

    NVIDIA Nemotron 3 Nano Omni 现已上线 Together AI 平台,这是一款支持视频、图像、音频和语言的多模态开放模型。其 30B A3B MoE 架构每次激活约 3B 参数,支持最多 256K tokens 的共享多模态上下文,并在单一推理循环中完成跨模态推理。

    推荐理由:单一模型统一多模态推理降低了多模型拼接的复杂度,对构建多模态智能体系统的开发者具有直接参考价值。

3月31日周二
  1. Mistral AI61

    Spaces:为人类与 AI 代理打造的 CLI

    Mistral AI 发布 Spaces CLI,为人类开发者和 AI 智能体提供统一命令行接口。文章提出交互输入应有 flag 等价、状态显式化、插件可自省等原则,并指出生成 context.json 和 AGENTS.md 可显著减少智能体错误。从单提示到部署上线仅需不到 10 分钟。

    推荐理由:原文系统阐述了让 CLI 同时服务人类与 AI 智能体的设计原则,涵盖 flag 等价、显式状态、插件化等模式,读者可据此构建更可组合、可脚本化的开发者工具。

3月25日周三
  1. Google Research67

    Google 发布 Vibe Coding XR,结合 Gemini 与 XR Blocks 加速原生 XR 应用原型

    Google Research 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示转为具备物理感知的可运行 Android XR 应用,整个过程不到 60 秒。

    推荐理由:原文给出了从自然语言到可运行 Android XR 应用的端到端流程与实测基线,读者可据此判断自身原型开发是否值得接入。

  2. Google Research60

    TurboQuant:通过极致压缩重新定义 AI 效率

    Google Research 提出 TurboQuant 压缩算法,在零精度损失下将 KV cache 压缩至 3 bits,并在 H100 上实现 8x 注意力计算加速。配合 QJL 与 PolarQuant 方法,在 LongBench 等长上下文基准上保持模型性能,同时显著降低内存与检索开销。

    推荐理由:原文给出 TurboQuant 在 KV cache 和向量搜索上的压缩比与速度提升数据,读者可据此评估其工程落地价值。

3月18日周三
  1. Together AI62

    Together AI 扩展微调服务:支持工具调用、推理与视觉模型微调

    Together AI 扩展 Together Fine-Tuning,原生支持工具调用、推理与视觉语言模型微调,并升级训练栈以支持 100B+ 参数模型、最高 6 倍吞吐提升和 100GB 数据集。

    推荐理由:原文给出工具调用、推理与视觉模型微调的新支持,以及训练吞吐和数据集上限提升,读者可据此评估自身多轮工作流的迭代成本与可靠性改善空间。

3月5日周四
  1. Together AI72

    FlashAttention-4:面向 Blackwell 非对称硬件的算法与 Kernel 协同设计

    FlashAttention-4 在 B200 上 BF16 最高达 1605 TFLOPs/s(71% 利用率),比 cuDNN 9.13 快 1.3×、比 Triton 快 2.7×。通过前向 softmax 与 MMA 重叠、TMEM 缓存中间结果、2-CTA MMA 降共享内存流量,以及确定性模式提升可复现性。

    推荐理由:原文给出了 B200 上的具体吞吐数据和对比倍数,读者可据此评估 FlashAttention-4 在实际训练中的加速潜力。

3月4日周三
  1. Together AI64

    Together AI 提出缓存感知的预填充-解码分离架构 CPD,长上下文推理可持续 QPS 提升约 35–40%

    Together AI 发布缓存感知的预填充-解码分离架构(CPD),将推理分为 Pre-Prefill、Prefill 和 Decode 三层,通过缓存复用和 RDMA 共享 KV cache 让暖请求绕过冷请求的预填充队列。

    推荐理由:通过区分冷热请求并引入三级 KV cache 层次,在长上下文混合负载下将可持续 QPS 提升约 35–40%。

2月25日周三
  1. Meta Engineering · AI72

    Meta 开源 RCCLX:面向 AMD 平台的 GPU 通信增强库

    Meta 开源 RCCLX(基于 RCCL 的增强版),集成 Torchcomms 并将 CTran 移植到 AMD 平台,支持 AllToAllvDynamic 等特性。新增 Direct Data Access 与低精度集合通信,在 MI300X 上解码小消息延迟降低 10–50%,前向计算加速 10–30%,端到端推理延迟下降约 9–10%、吞吐提升约 7%,GSM8K 偏差约 0.3%。

    推荐理由:原文给出 AMD 平台通信库的能力变化与量化结果,读者可据此评估 RCCLX 对现有训练与推理工作流的实际影响。