Skip to content
arXiv · Computer Vision· Junzhe Shi, Yuan Gan, Shida Jiang·· 4 hr agoAI score53

研究解释 VLM 为何漏检小目标及局部放大何时安全

Why VLMs Miss Small Objects, and When Zooming In Is Safe

AI brief

论文提出用目标侧向视觉 token 数 S 与单次调用覆盖内容 L 解释 VLM 在大图中漏检小目标:整图送入时目标侧 token 至多为 m*sqrt(N/(WH)),token 预算翻倍只让最大 S 提高约 41%,且达到所需 S 至少需要约 S^2 量级 token。

Source: arXiv · Computer Vision · arxiv.org