跳到正文
原文
Together AI·· 2026-05-11精选AI 评分72

DeepSeek-V4 发布:百万上下文是推理系统问题

Serving DeepSeek-V4: why million-token context is an inference systems problem

AI 导读

DeepSeek-V4 支持 1M 上下文窗口,通过 CSA/HCA/SWA 混合注意力在 token 轴压缩 KV 缓存。在 NVIDIA HGX B200 上,缓存策略使单节点 KV 容量从约 1.2M token 提升至 3.7M token。

推荐理由

V4 把百万上下文变成系统问题,读者可据此判断自身负载是否落在压缩注意力与缓存策略的有效区间。

来源:Together AI · together.ai