跳到正文
热点事件持续更新

研究:VLM小物体识别极限与局部分解规则

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

该研究关注视觉语言模型(VLM)在大图中漏检小目标的问题。论文提出用目标侧向视觉 token 数 S 与单次调用覆盖内容 L 来解释这一现象:整图送入时,目标侧 token 至多为 m*sqrt(N/(WH));token 预算翻倍只让最大 S 提高约 41%,且达到所需 S 至少需要约 S^2 量级 token。研究据此说明局部放大在何种条件下是安全的。目前未见与早先报道矛盾之处。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · Computer Vision
    研究解释 VLM 为何漏检小目标及局部放大何时安全

    论文提出用目标侧向视觉 token 数 S 与单次调用覆盖内容 L 解释 VLM 在大图中漏检小目标:整图送入时目标侧 token 至多为 m*sqrt(N/(WH)),token 预算翻倍只让最大 S 提高约 41%,且达到所需 S 至少需要约 S^2 量级 token。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。