跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 81–86 条 · 共 86 条
2月25日周三
  1. Meta Engineering · AI72

    Meta 开源 RCCLX:面向 AMD 平台的 GPU 通信增强库

    Meta 开源 RCCLX(基于 RCCL 的增强版),集成 Torchcomms 并将 CTran 移植到 AMD 平台,支持 AllToAllvDynamic 等特性。新增 Direct Data Access 与低精度集合通信,在 MI300X 上解码小消息延迟降低 10–50%,前向计算加速 10–30%,端到端推理延迟下降约 9–10%、吞吐提升约 7%,GSM8K 偏差约 0.3%。

    推荐理由:原文给出 AMD 平台通信库的能力变化与量化结果,读者可据此评估 RCCLX 对现有训练与推理工作流的实际影响。

2月19日周四
  1. Together AI62

    Consistency Diffusion Language Models:推理加速最高 14 倍且质量不下降

    Together AI 提出 CDLM 训练方案,让扩散语言模型在块因果掩码下做多 token 最终化并启用精确块级 KV 缓存。实验显示 CDLM–Dream 在 GSM8K-CoT 与 MBPP-Instruct 上分别提速 11.2x 与 14.5x,多数任务精度变化很小。

    推荐理由:通过训练让扩散语言模型在块内自回归解码并启用精确 KV 缓存,在保持质量的同时显著减少推理步数与延迟。

2月12日周四
  1. Together AI62

    Together AI 推出 Dedicated Container Inference,定制模型推理速度最高提升 2.6 倍

    Together AI 发布 Dedicated Container Inference,支持用户以 Docker 容器方式部署自定义生成式媒体模型,并由平台负责自动扩缩容、队列、流量隔离与监控。客户实测视频生成等任务推理速度提升 1.4–2.6 倍;在 Together GPU Cloud 训练的模型可直接部署,无需传输产物。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

12月3日周三
  1. Mistral AI87

    Mistral 3 发布:涵盖 Ministral 3 与 Mistral Large 3 的开源模型家族

    Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。

    推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。

7月30日周三
3月7日周五
  1. Mistral AI72

    Mistral OCR 文档理解 API 发布

    Mistral 推出 OCR API,支持图像和 PDF 输入,以 interleaved 文本与图片结构化输出,并作为默认文档理解模型集成到 Le Chat。API 在 la Plateforme 以 1000 页/$ 开放,批量推理每美元页数约翻倍,同时提供自托管选项。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。