跳到正文
热点事件持续更新

Layered-VQA:场景分层揭示VLM组合推理缺陷

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

研究提出 Layered-VQA 数据集,包含 93 个场景、300 个问题,每个图像分解为有序 RGBA 层,问题标注支持层、最小充分层和干扰层。评估 11 个 3B-32B 开源权重 VLM 与 2 个专有模型,共 187,200 次对话、1.74M 次交叉评判。发现三方面失败:场景碎片化显著降低准确率、Oracle Inversion、证据需求增加时 grounding 退化快于答案准确率。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv · Computer Vision
    Composition, Not Conversation: VLMs Lose the Scene, Not the Thread

    研究提出 Layered-VQA 数据集,包含 93 个场景、300 个问题,每个图像分解为有序 RGBA 层,问题标注支持层、最小充分层和干扰层。评估 11 个 3B-32B 开源权重 VLM 与 2 个专有模型,共 187,200 次对话、1.74M 次交叉评判。发现三方面失败:场景碎片化显著降低准确率、Oracle Inversion、证据需求增加时 grounding 退化快于答案准确率。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。