跳到正文
原文
arXiv · Computer Vision· Donghyun Han, Jangho Park, Yuseok Bae·· 3 小时前AI 评分28

Foveated Compression:面向 token 高效视觉语言模型的选择性高分辨率保留

Foveated Compression: Selective High-Resolution Preservation for Token-Efficient VLMs

AI 导读

研究提出 Foveated Compression,在固定 token 预算下用一次全分辨率编码混合原生与压缩分辨率视觉 token,并借 Foveated Merger 与 Foveated Selector 选择九个空间格之一保留原生分辨率。

来源:arXiv · Computer Vision · arxiv.org