arXiv · Computer Vision· Seyoung Jeong, Jong Pil Yun, Sang Jun Lee·· 4 hr agoAI score27
ReFIT:面向加速图像理解的自适应视觉 token 削减
Adaptive Visual Token Reduction for Accelerated Image Understanding
AI brief
论文提出 ReFIT,一种面向高效 LVLM 推理的指令引导视觉 token 削减框架,由 Relevance-Guided Window Reshaping(RWR)与 Instruction-Guided Token Refinement(ITR)组成。
Source: arXiv · Computer Vision · arxiv.org