arXiv · Computer Vision· Junzhe Shi, Yuan Gan, Shida Jiang·· 4 hr agoAI score53
研究解释 VLM 为何漏检小目标及局部放大何时安全
Why VLMs Miss Small Objects, and When Zooming In Is Safe
AI brief
论文提出用目标侧向视觉 token 数 S 与单次调用覆盖内容 L 解释 VLM 在大图中漏检小目标:整图送入时目标侧 token 至多为 m*sqrt(N/(WH)),token 预算翻倍只让最大 S 提高约 41%,且达到所需 S 至少需要约 S^2 量级 token。
Source: arXiv · Computer Vision · arxiv.org