arXiv · Computer Vision· Donghyun Han, Jangho Park, Yuseok Bae·· 4 hr agoAI score28
Foveated Compression:面向 token 高效视觉语言模型的选择性高分辨率保留
Foveated Compression: Selective High-Resolution Preservation for Token-Efficient VLMs
AI brief
研究提出 Foveated Compression,在固定 token 预算下用一次全分辨率编码混合原生与压缩分辨率视觉 token,并借 Foveated Merger 与 Foveated Selector 选择九个空间格之一保留原生分辨率。
Source: arXiv · Computer Vision · arxiv.org