跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

159条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 141–159 条 · 共 159 条
3月25日周三
  1. Google Research67

    Google 发布 Vibe Coding XR,结合 Gemini 与 XR Blocks 加速原生 XR 应用原型

    Google Research 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架结合,把自然语言提示转为具备物理感知的可运行 Android XR 应用,整个过程不到 60 秒。

    推荐理由:原文给出了从自然语言到可运行 Android XR 应用的端到端流程与实测基线,读者可据此判断自身原型开发是否值得接入。

  2. Google Research60

    TurboQuant:通过极致压缩重新定义 AI 效率

    Google Research 提出 TurboQuant 压缩算法,在零精度损失下将 KV cache 压缩至 3 bits,并在 H100 上实现 8x 注意力计算加速。配合 QJL 与 PolarQuant 方法,在 LongBench 等长上下文基准上保持模型性能,同时显著降低内存与检索开销。

    推荐理由:原文给出 TurboQuant 在 KV cache 和向量搜索上的压缩比与速度提升数据,读者可据此评估其工程落地价值。

3月18日周三
  1. Together AI62

    Together AI 扩展微调服务:支持工具调用、推理与视觉模型微调

    Together AI 扩展 Together Fine-Tuning,原生支持工具调用、推理与视觉语言模型微调,并升级训练栈以支持 100B+ 参数模型、最高 6 倍吞吐提升和 100GB 数据集。

    推荐理由:原文给出工具调用、推理与视觉模型微调的新支持,以及训练吞吐和数据集上限提升,读者可据此评估自身多轮工作流的迭代成本与可靠性改善空间。

3月5日周四
  1. Together AI72

    FlashAttention-4:面向 Blackwell 非对称硬件的算法与 Kernel 协同设计

    FlashAttention-4 在 B200 上 BF16 最高达 1605 TFLOPs/s(71% 利用率),比 cuDNN 9.13 快 1.3×、比 Triton 快 2.7×。通过前向 softmax 与 MMA 重叠、TMEM 缓存中间结果、2-CTA MMA 降共享内存流量,以及确定性模式提升可复现性。

    推荐理由:原文给出了 B200 上的具体吞吐数据和对比倍数,读者可据此评估 FlashAttention-4 在实际训练中的加速潜力。

3月4日周三
  1. Together AI64

    Together AI 提出缓存感知的预填充-解码分离架构 CPD,长上下文推理可持续 QPS 提升约 35–40%

    Together AI 发布缓存感知的预填充-解码分离架构(CPD),将推理分为 Pre-Prefill、Prefill 和 Decode 三层,通过缓存复用和 RDMA 共享 KV cache 让暖请求绕过冷请求的预填充队列。

    推荐理由:通过区分冷热请求并引入三级 KV cache 层次,在长上下文混合负载下将可持续 QPS 提升约 35–40%。

2月25日周三
  1. Meta Engineering · AI72

    Meta 开源 RCCLX:面向 AMD 平台的 GPU 通信增强库

    Meta 开源 RCCLX(基于 RCCL 的增强版),集成 Torchcomms 并将 CTran 移植到 AMD 平台,支持 AllToAllvDynamic 等特性。新增 Direct Data Access 与低精度集合通信,在 MI300X 上解码小消息延迟降低 10–50%,前向计算加速 10–30%,端到端推理延迟下降约 9–10%、吞吐提升约 7%,GSM8K 偏差约 0.3%。

    推荐理由:原文给出 AMD 平台通信库的能力变化与量化结果,读者可据此评估 RCCLX 对现有训练与推理工作流的实际影响。

2月19日周四
  1. Together AI62

    Consistency Diffusion Language Models:推理加速最高 14 倍且质量不下降

    Together AI 提出 CDLM 训练方案,让扩散语言模型在块因果掩码下做多 token 最终化并启用精确块级 KV 缓存。实验显示 CDLM–Dream 在 GSM8K-CoT 与 MBPP-Instruct 上分别提速 11.2x 与 14.5x,多数任务精度变化很小。

    推荐理由:通过训练让扩散语言模型在块内自回归解码并启用精确 KV 缓存,在保持质量的同时显著减少推理步数与延迟。

2月12日周四
  1. Together AI62

    Together AI 推出 Dedicated Container Inference,定制模型推理速度最高提升 2.6 倍

    Together AI 发布 Dedicated Container Inference,支持用户以 Docker 容器方式部署自定义生成式媒体模型,并由平台负责自动扩缩容、队列、流量隔离与监控。客户实测视频生成等任务推理速度提升 1.4–2.6 倍;在 Together GPU Cloud 训练的模型可直接部署,无需传输产物。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

1月16日周五
  1. Ollama Blog76

    Ollama 兼容 Anthropic API,Claude Code 可使用开源模型

    Ollama v0.14.0 起兼容 Anthropic Messages API,Claude Code 可通过 --model 指定本地模型(如 gpt-oss:20b、qwen3-coder)或云端模型(如 glm-4.7:cloud、minimax-m2.1:cloud)运行,并支持工具调用、流式对话、系统提示与视觉输入。

    推荐理由:Ollama 兼容 Anthropic API 后,Claude Code 可直连本地或云端开源模型,为开发者提供无需切换平台即可替换模型的选择。

12月3日周三
  1. Mistral AI87

    Mistral 3 发布:涵盖 Ministral 3 与 Mistral Large 3 的开源模型家族

    Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。

    推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。

10月23日周四
  1. Ollama Blog62

    Ollama 发布 NVIDIA DGX Spark 性能测试结果

    Ollama 在 DGX Spark 固件 580.95.05 与 Ollama v0.12.6 下测试 gpt-oss、gemma3、llama3.1、deepseek-r1、qwen3 等模型的 prefill 与 decode 速度,并给出固件升级与安装命令。

    推荐理由:原文给出 DGX Spark 上多模型的量化与速度数据,读者可据此评估本地部署的吞吐与显存匹配度。

9月19日周五
  1. Ollama Blog60

    Ollama 推出云端模型预览

    Ollama 发布云端模型预览功能,支持在数据中心硬件上运行本地无法容纳的大型模型,同时保持本地工具体验和 OpenAI 兼容 API。可用模型包括 qwen3-coder:480b-cloud、gpt-oss:120b-cloud、gpt-oss:20b-cloud 和 deepseek-v3.1:671b-cloud,需登录 ollama.com 使用。

    推荐理由:本地工具链无缝接入云端大模型,读者可据此评估在不更换工作流的前提下扩展模型规模的可行性。

8月5日周二
  1. Ollama Blog73

    OpenAI 发布 gpt-oss 开源模型(20B 与 120B)

    OpenAI 联合 Ollama 发布 gpt-oss-20b 与 gpt-oss-120b 两个开源权重模型,支持 Agentic 能力、链式推理、可配置推理强度和 MXFP4 量化,20B 模型可在 16GB 内存运行,120B 模型可单卡 80GB GPU 部署。

    推荐理由:本地即可运行 OpenAI 最新开源权重模型,读者能据此评估自身硬件是否满足部署门槛。

7月30日周三
6月3日周二
  1. Ollama Blog67

    Minions:Ollama 与前沿模型的安全隐私协作协议

    Stanford Hazy Research 推出 Minions 协议,通过 NVIDIA Hopper H100 远程证明与加密 enclave 实现 Ollama 本地模型与云端前沿模型的端到端加密协作,敏感上下文不离开设备,延迟增加不到 1%。项目已开源并提供 Streamlit 演示与 Python 示例代码。

    推荐理由:原文给出了端到端加密协作协议的实现路径和实测开销,读者可据此评估本地-云端混合架构的安全性与成本平衡。

3月7日周五
  1. Mistral AI72

    Mistral OCR 文档理解 API 发布

    Mistral 推出 OCR API,支持图像和 PDF 输入,以 interleaved 文本与图片结构化输出,并作为默认文档理解模型集成到 Le Chat。API 在 la Plateforme 以 1000 页/$ 开放,批量推理每美元页数约翻倍,同时提供自托管选项。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

10月21日周一
6月21日周三
  1. TensorFlow Blog62

    TensorFlow Lite 实现移动端胎儿超声评估

    Google Research 推出基于 TensorFlow Lite 的移动端胎儿超声评估模型,支持非专家通过盲扫协议获取孕周与胎位预测。模型在 Pixel 设备上实现 30 帧/秒以上实时推理,且无精度损失,并提供扫查质量反馈。

    推荐理由:原文给出移动端实时推理速度与质量反馈机制,读者可据此评估该工具在低资源场景下的可用性。