Skip to content
arXiv · Machine Learning Theory· Sara Abdali, Jongwoo Ko, Pashmina Cameron·· 4 hr agoAI score37

AttSVD:基于注意力引导 SVD 的提示自适应低秩 KV Cache 压缩

AttSVD:Prompt-Adaptive Low-Rank KV Cache Compression via Attention-Guided SVD

AI brief

AttSVD 是一种免训练的 KV Cache 压缩方法,按每个提示词的注意力几何做在线截断 SVD,保留注意力实际读取的方向,按保留秩比例降低每头 KV 内存。提出累积与流式两种解码时缓存策略,并以逐矩阵能量规则和注意力感知基截断做自适应压缩。在多个模型、agentic benchmark 与完整 LongBench 上与稠密缓存持平,KV 内存最多节省 50%。

Source: arXiv · Machine Learning Theory · arxiv.org