跳到正文
原文
Together AI·· 2026-03-04精选AI 评分64

Together AI 提出缓存感知的预填充-解码分离架构 CPD,长上下文推理可持续 QPS 提升约 35–40%

Cache-aware prefill–decode disaggregation (CPD) for up to 40% faster long-context LLM serving

AI 导读

Together AI 发布缓存感知的预填充-解码分离架构(CPD),将推理分为 Pre-Prefill、Prefill 和 Decode 三层,通过缓存复用和 RDMA 共享 KV cache 让暖请求绕过冷请求的预填充队列。

推荐理由

通过区分冷热请求并引入三级 KV cache 层次,在长上下文混合负载下将可持续 QPS 提升约 35–40%。

来源:Together AI · together.ai