Google Research·· 2026-03-25精选AI 评分60
TurboQuant:通过极致压缩重新定义 AI 效率
TurboQuant: Redefining AI efficiency with extreme compression
AI 导读
Google Research 提出 TurboQuant 压缩算法,在零精度损失下将 KV cache 压缩至 3 bits,并在 H100 上实现 8x 注意力计算加速。配合 QJL 与 PolarQuant 方法,在 LongBench 等长上下文基准上保持模型性能,同时显著降低内存与检索开销。
推荐理由
原文给出 TurboQuant 在 KV cache 和向量搜索上的压缩比与速度提升数据,读者可据此评估其工程落地价值。
来源:Google Research · research.google