Skip to content
arXiv · Machine Learning Theory· Davis Wertheimer, Haochen Shen, Ahan Gupta, Derrick Liu, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang·· 4 hr agoAI score32

A Self-Pruning Transformer:Universal Attention 实现极限 KV-Cache 压缩

A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention

AI brief

论文提出 Universal Attention,一种端到端可训练的 Transformer 架构,用复合衰减机制作为自适应剪枝准则,在保留 RoPE 位置嵌入与 Softmax attention 的同时移除对 attention 计算贡献最小的 token。

Source: arXiv · Machine Learning Theory · arxiv.org