arXiv · Computer Vision· Hao Jiang, Yiru Mao, Tianpeng Bu, Hao Zhou, Hongtao Duan, Wang Jing, Bowen Xu, Xin Chen, Lulu Hu, Bin Yang, Yongliang Tao, Minying Zhang·· 3 小时前AI 评分31
V-CoLA:面向线性注意力的视觉 token 压缩
V-CoLA: Vision Token Compression with Linear Attention
AI 导读
V-CoLA 是一种专为线性注意力设计的免训练视觉 token 压缩框架,针对 Qwen3.5 等混合架构提出唯一性感知的 token 重要性准则与自适应 token 合并策略。实验显示其在仅保留 50.0% 视觉 token 时达到原始性能的 99.5%,保留 12.5% 时仍超过 88.0%,并实现 1.86× 至 6.15× 的预填充加速。
来源:arXiv · Computer Vision · arxiv.org