arXiv · Computer Vision· Seyoung Jeong, Jong Pil Yun, Sang Jun Lee·· 3 小时前AI 评分27
ReFIT:面向加速图像理解的自适应视觉 token 削减
Adaptive Visual Token Reduction for Accelerated Image Understanding
AI 导读
论文提出 ReFIT,一种面向高效 LVLM 推理的指令引导视觉 token 削减框架,由 Relevance-Guided Window Reshaping(RWR)与 Instruction-Guided Token Refinement(ITR)组成。
来源:arXiv · Computer Vision · arxiv.org