arXiv · Machine Learning· Nenad Banfic·· 7 小时前AI 评分34
HeadGuard:低比特 VLM KV-Cache 量化中的选择性头部保护
HeadGuard: Selective Head Protection for Low-Bit VLM KV-Cache Quantization
AI 导读
HeadGuard 通过固定高精度掩码保护约 1/8 的 KV 头部,在 2 位量化下将八模型六任务判别平均分从 0.436 提升至 0.580。Qwen 和 InternVL 收益最大,键保护可在更低存储成本下保留大部分恢复效果,且兼容三种基础量化器与两种校准数据集。
来源:arXiv · Machine Learning · arxiv.org