跳到正文

#部署/工程

今日 67 条
3月25日周三
  1. Google Research60

    TurboQuant:通过极致压缩重新定义 AI 效率

    Google Research 提出 TurboQuant 压缩算法,在零精度损失下将 KV cache 压缩至 3 bits,并在 H100 上实现 8x 注意力计算加速。配合 QJL 与 PolarQuant 方法,在 LongBench 等长上下文基准上保持模型性能,同时显著降低内存与检索开销。

    推荐理由:原文给出 TurboQuant 在 KV cache 和向量搜索上的压缩比与速度提升数据,读者可据此评估其工程落地价值。

3月18日周三
  1. Together AI62

    Together AI 扩展微调服务:支持工具调用、推理与视觉模型微调

    Together AI 扩展 Together Fine-Tuning,原生支持工具调用、推理与视觉语言模型微调,并升级训练栈以支持 100B+ 参数模型、最高 6 倍吞吐提升和 100GB 数据集。

    推荐理由:原文给出工具调用、推理与视觉模型微调的新支持,以及训练吞吐和数据集上限提升,读者可据此评估自身多轮工作流的迭代成本与可靠性改善空间。

3月17日周二
3月16日周一
3月10日周二
3月5日周四
  1. Together AI72

    FlashAttention-4:面向 Blackwell 非对称硬件的算法与 Kernel 协同设计

    FlashAttention-4 在 B200 上 BF16 最高达 1605 TFLOPs/s(71% 利用率),比 cuDNN 9.13 快 1.3×、比 Triton 快 2.7×。通过前向 softmax 与 MMA 重叠、TMEM 缓存中间结果、2-CTA MMA 降共享内存流量,以及确定性模式提升可复现性。

    推荐理由:原文给出了 B200 上的具体吞吐数据和对比倍数,读者可据此评估 FlashAttention-4 在实际训练中的加速潜力。

3月4日周三
  1. Together AI64

    Together AI 提出缓存感知的预填充-解码分离架构 CPD,长上下文推理可持续 QPS 提升约 35–40%

    Together AI 发布缓存感知的预填充-解码分离架构(CPD),将推理分为 Pre-Prefill、Prefill 和 Decode 三层,通过缓存复用和 RDMA 共享 KV cache 让暖请求绕过冷请求的预填充队列。

    推荐理由:通过区分冷热请求并引入三级 KV cache 层次,在长上下文混合负载下将可持续 QPS 提升约 35–40%。

3月2日周一
2月26日周四
2月25日周三
  1. Meta Engineering · AI72

    Meta 开源 RCCLX:面向 AMD 平台的 GPU 通信增强库

    Meta 开源 RCCLX(基于 RCCL 的增强版),集成 Torchcomms 并将 CTran 移植到 AMD 平台,支持 AllToAllvDynamic 等特性。新增 Direct Data Access 与低精度集合通信,在 MI300X 上解码小消息延迟降低 10–50%,前向计算加速 10–30%,端到端推理延迟下降约 9–10%、吞吐提升约 7%,GSM8K 偏差约 0.3%。

    推荐理由:原文给出 AMD 平台通信库的能力变化与量化结果,读者可据此评估 RCCLX 对现有训练与推理工作流的实际影响。

2月23日周一
2月19日周四
  1. Together AI62

    Consistency Diffusion Language Models:推理加速最高 14 倍且质量不下降

    Together AI 提出 CDLM 训练方案,让扩散语言模型在块因果掩码下做多 token 最终化并启用精确块级 KV 缓存。实验显示 CDLM–Dream 在 GSM8K-CoT 与 MBPP-Instruct 上分别提速 11.2x 与 14.5x,多数任务精度变化很小。

    推荐理由:通过训练让扩散语言模型在块内自回归解码并启用精确 KV 缓存,在保持质量的同时显著减少推理步数与延迟。

2月12日周四
  1. Together AI62

    Together AI 推出 Dedicated Container Inference,定制模型推理速度最高提升 2.6 倍

    Together AI 发布 Dedicated Container Inference,支持用户以 Docker 容器方式部署自定义生成式媒体模型,并由平台负责自动扩缩容、队列、流量隔离与监控。客户实测视频生成等任务推理速度提升 1.4–2.6 倍;在 Together GPU Cloud 训练的模型可直接部署,无需传输产物。

    推荐理由:原文给出了能力变化和开放入口,读者可以据此判断它会怎样改变现有工作流。

2月1日周日
1月23日周五
1月22日周四
1月16日周五
  1. Ollama Blog76

    Ollama 兼容 Anthropic API,Claude Code 可使用开源模型

    Ollama v0.14.0 起兼容 Anthropic Messages API,Claude Code 可通过 --model 指定本地模型(如 gpt-oss:20b、qwen3-coder)或云端模型(如 glm-4.7:cloud、minimax-m2.1:cloud)运行,并支持工具调用、流式对话、系统提示与视觉输入。

    推荐理由:Ollama 兼容 Anthropic API 后,Claude Code 可直连本地或云端开源模型,为开发者提供无需切换平台即可替换模型的选择。

12月3日周三
  1. Mistral AI87

    Mistral 3 发布:涵盖 Ministral 3 与 Mistral Large 3 的开源模型家族

    Mistral 3 包含 Ministral 3(3B/8B/14B)与 Mistral Large 3(41B 活跃/675B 总参数稀疏 MoE),全部 Apache 2.0 开源。

    推荐理由:Mistral 3 同时覆盖从边缘到数据中心的稠密与稀疏 MoE 模型,并给出 NVFP4 checkpoint 与多平台部署入口,读者可据此评估自托管与云端方案的成本与性能取舍。

11月19日周三
10月24日周五
10月23日周四
  1. Ollama Blog62

    Ollama 发布 NVIDIA DGX Spark 性能测试结果

    Ollama 在 DGX Spark 固件 580.95.05 与 Ollama v0.12.6 下测试 gpt-oss、gemma3、llama3.1、deepseek-r1、qwen3 等模型的 prefill 与 decode 速度,并给出固件升级与安装命令。

    推荐理由:原文给出 DGX Spark 上多模型的量化与速度数据,读者可据此评估本地部署的吞吐与显存匹配度。

10月18日周六
10月13日周一
10月1日周三
9月29日周一
9月24日周三
  1. Ollama Blog40

    Ollama 推出 Web Search API

    Ollama 新增 Web Search API,提供免费额度与云端更高速率限制,通过 REST API 及 Python/JavaScript 库调用,为模型补充实时网页信息以减少幻觉、提升准确性。该能力可配合 Qwen 3 4B 等模型构建搜索代理,并支持 gpt-oss 等模型执行长时研究任务。

9月23日周二
  1. Ollama Blog58

    Ollama 推出新的模型调度系统

    Ollama 发布新的模型调度引擎,精确测量模型所需内存,减少内存溢出崩溃并提升 GPU 利用率。示例显示 gemma3:12b 在 128k 上下文下 token 生成速度从 52.02 提升至 85.54 tokens/s,mistral-small3.2 提示评估速度从 127.84 提升至 1380.24 tokens/s。新功能默认适用于新引擎实现的所有模型。

9月19日周五
  1. Ollama Blog60

    Ollama 推出云端模型预览

    Ollama 发布云端模型预览功能,支持在数据中心硬件上运行本地无法容纳的大型模型,同时保持本地工具体验和 OpenAI 兼容 API。可用模型包括 qwen3-coder:480b-cloud、gpt-oss:120b-cloud、gpt-oss:20b-cloud 和 deepseek-v3.1:671b-cloud,需登录 ollama.com 使用。

    推荐理由:本地工具链无缝接入云端大模型,读者可据此评估在不更换工作流的前提下扩展模型规模的可行性。

9月9日周二
8月20日周三
8月5日周二
  1. Ollama Blog73

    OpenAI 发布 gpt-oss 开源模型(20B 与 120B)

    OpenAI 联合 Ollama 发布 gpt-oss-20b 与 gpt-oss-120b 两个开源权重模型,支持 Agentic 能力、链式推理、可配置推理强度和 MXFP4 量化,20B 模型可在 16GB 内存运行,120B 模型可单卡 80GB GPU 部署。

    推荐理由:本地即可运行 OpenAI 最新开源权重模型,读者能据此评估自身硬件是否满足部署门槛。

8月1日周五
7月30日周三
  1. Ollama Blog35

    Ollama 推出 macOS 与 Windows 新应用

    Ollama 的新应用已在 macOS 和 Windows 上线,支持模型下载与对话、文件拖拽上传(包括文本和 PDF),并可处理代码文件。内置的多模态引擎支持向 Gemma 3 等模型发送图片,上下文长度可在设置中调整但需要更多内存。新应用可从 Ollama 官网下载,CLI 版本仍可从 GitHub releases 页面获取。

7月3日周四
  1. Mistral AI38

    Mistral AI 推出 AI for Citizens 计划

    Mistral AI 推出 AI for Citizens 计划,帮助各国政府与公共机构按本地需求部署 AI,改造公共服务。该计划已与法国、卢森堡、新加坡、荷兰、英格兰、瑞士等国的政府、国防部门、公共机构及教育机构合作。方案提供自托管、本地 AI 数据中心、SaaS 与 serverless API 等部署选择,并支持数据主权。

6月11日周三
6月4日周三
6月3日周二
  1. Ollama Blog67

    Minions:Ollama 与前沿模型的安全隐私协作协议

    Stanford Hazy Research 推出 Minions 协议,通过 NVIDIA Hopper H100 远程证明与加密 enclave 实现 Ollama 本地模型与云端前沿模型的端到端加密协作,敏感上下文不离开设备,延迟增加不到 1%。项目已开源并提供 Streamlit 演示与 Python 示例代码。

    推荐理由:原文给出了端到端加密协作协议的实现路径和实测开销,读者可据此评估本地-云端混合架构的安全性与成本平衡。

4月9日周三