跳到正文
原文
arXiv · Computer Vision· M. Moein Esfahani, Sepehr Salem, Mohammed Alser, Vince Calhoun·· 3 小时前AI 评分33

视觉模型学习物理约束还是渲染捷径?面向接地物理一致性的反事实基准

Do Vision Models Learn Physical Constraints or Rendering Shortcuts? A Counterfactual Benchmark for Grounded Physical Consistency

AI 导读

研究提出物理合理性诊断任务,要求检测编辑图像是否违反场景物理、命名违规类型、定位受影响区域并用语言解释失败,并构建反事实基准,用 Mitsuba 3 生成 5,500 张图像,覆盖 500 个场景族,每族含 1 张干净图与 10 个涉及阴影、反射、支撑、表面响应和遮挡的匹配违规。

来源:arXiv · Computer Vision · arxiv.org