热点事件持续更新
研究:VLM小物体识别极限与局部分解规则
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
该研究关注视觉语言模型(VLM)在大图中漏检小目标的问题。论文提出用目标侧向视觉 token 数 S 与单次调用覆盖内容 L 来解释这一现象:整图送入时,目标侧 token 至多为 m*sqrt(N/(WH));token 预算翻倍只让最大 S 提高约 41%,且达到所需 S 至少需要约 S^2 量级 token。研究据此说明局部放大在何种条件下是安全的。目前未见与早先报道矛盾之处。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
论文给出小目标漏检的 token 量化解释,并界定局部放大安全条件。报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv · Computer Vision研究解释 VLM 为何漏检小目标及局部放大何时安全
论文提出用目标侧向视觉 token 数 S 与单次调用覆盖内容 L 解释 VLM 在大图中漏检小目标:整图送入时目标侧 token 至多为 m*sqrt(N/(WH)),token 预算翻倍只让最大 S 提高约 41%,且达到所需 S 至少需要约 S^2 量级 token。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。