跳到正文
原文
arXiv · Computer Vision· Seyoung Jeong, Jong Pil Yun, Sang Jun Lee·· 3 小时前AI 评分27

ReFIT:面向加速图像理解的自适应视觉 token 削减

Adaptive Visual Token Reduction for Accelerated Image Understanding

AI 导读

论文提出 ReFIT,一种面向高效 LVLM 推理的指令引导视觉 token 削减框架,由 Relevance-Guided Window Reshaping(RWR)与 Instruction-Guided Token Refinement(ITR)组成。

来源:arXiv · Computer Vision · arxiv.org