arXiv · Computer Vision· Jinchang Zhang, Guoyu Lu·· 16 小时前AI 评分34
多模态大语言模型能看见并说出空间事实却不会使用:SpaceConflict 基准与 OSS 监督方法
Seeing, Saying, but Not Using: From Reportable Spatial Facts to Usable States in Multimodal Large Language Models
AI 导读
研究提出 SpaceConflict 基准,含 23,196 条输入,覆盖 L1 事实绑定、L2 关系组合、L3 跨观察一致性、L4 变换下状态判断四级空间状态构建与使用。
来源:arXiv · Computer Vision · arxiv.org