arXiv · Computer Vision· Wenhan Yang, Anirudh Rao, Ashwin Chandra·· 3 小时前AI 评分42
HAWK:重新思考多模态草稿预测以加速推测解码
HAWK: Rethinking Multimodal Drafting for Speculative Decoding
AI 导读
HAWK 针对大视觉语言模型(LVLMs)的推测解码提出改进,通过表示相似度选择目标层并组合隐藏状态,同时将压缩后的视觉隐藏状态直接提供给浅层草稿模型。实验显示,在 SmolVLM-256M 上,HAWK 在 10 个多模态基准中将平均接受长度从 3.32 提升至 4.08,贪婪解码下速度从 2.19x 提高到 2.60x,采样模式下从 1.92x 提升至 2.19x。
来源:arXiv · Computer Vision · arxiv.org