Skip to content
arXiv · Computer Vision· Seyoung Jeong, Jong Pil Yun, Sang Jun Lee·· 4 hr agoAI score27

ReFIT:面向加速图像理解的自适应视觉 token 削减

Adaptive Visual Token Reduction for Accelerated Image Understanding

AI brief

论文提出 ReFIT,一种面向高效 LVLM 推理的指令引导视觉 token 削减框架,由 Relevance-Guided Window Reshaping(RWR)与 Instruction-Guided Token Refinement(ITR)组成。

Source: arXiv · Computer Vision · arxiv.org