arXiv · Machine Learning Theory· Davis Wertheimer, Haochen Shen, Ahan Gupta, Derrick Liu, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang·· 4 小时前AI 评分32
A Self-Pruning Transformer:Universal Attention 实现极限 KV-Cache 压缩
A Self-Pruning Transformer: Extreme KV-Cache Compression with Universal Attention
AI 导读
论文提出 Universal Attention,一种端到端可训练的 Transformer 架构,用复合衰减机制作为自适应剪枝准则,在保留 RoPE 位置嵌入与 Softmax attention 的同时移除对 attention 计算贡献最小的 token。
来源:arXiv · Machine Learning Theory · arxiv.org