arXiv · Computer Vision· M. Moein Esfahani, Sepehr Salem, Mohammed Alser, Vince Calhoun·· 4 hr agoAI score33
视觉模型学习物理约束还是渲染捷径?面向接地物理一致性的反事实基准
Do Vision Models Learn Physical Constraints or Rendering Shortcuts? A Counterfactual Benchmark for Grounded Physical Consistency
AI brief
研究提出物理合理性诊断任务,要求检测编辑图像是否违反场景物理、命名违规类型、定位受影响区域并用语言解释失败,并构建反事实基准,用 Mitsuba 3 生成 5,500 张图像,覆盖 500 个场景族,每族含 1 张干净图与 10 个涉及阴影、反射、支撑、表面响应和遮挡的匹配违规。
Source: arXiv · Computer Vision · arxiv.org