Together AI·· 2026-03-04精选AI 评分64
Together AI 提出缓存感知的预填充-解码分离架构 CPD,长上下文推理可持续 QPS 提升约 35–40%
Cache-aware prefill–decode disaggregation (CPD) for up to 40% faster long-context LLM serving
AI 导读
Together AI 发布缓存感知的预填充-解码分离架构(CPD),将推理分为 Pre-Prefill、Prefill 和 Decode 三层,通过缓存复用和 RDMA 共享 KV cache 让暖请求绕过冷请求的预填充队列。
推荐理由
通过区分冷热请求并引入三级 KV cache 层次,在长上下文混合负载下将可持续 QPS 提升约 35–40%。
来源:Together AI · together.ai