arXiv · Computer Vision· Donghyun Han, Jangho Park, Yuseok Bae·· 3 小时前AI 评分28
Foveated Compression:面向 token 高效视觉语言模型的选择性高分辨率保留
Foveated Compression: Selective High-Resolution Preservation for Token-Efficient VLMs
AI 导读
研究提出 Foveated Compression,在固定 token 预算下用一次全分辨率编码混合原生与压缩分辨率视觉 token,并借 Foveated Merger 与 Foveated Selector 选择九个空间格之一保留原生分辨率。
来源:arXiv · Computer Vision · arxiv.org