跳到正文
原文
arXiv · Computer Vision· Minsu Kim, Jaesung Choe, Jiwoo Lee, Yu-Chiang Frank Wang, Seon Joo Kim·· 3 小时前AI 评分30

RelationVGGT:用于 3D 空间关系分割的视觉几何 Transformer

RelationVGGT: Visual Geometry Transformers for 3D Spatial Relation Segmentation

AI 导读

RelationVGGT 提出一种前馈式、无姿态、多视角的 3D 空间关系分割框架,将视觉基础模型语义特征与 3D 几何基础模型几何表示结合,并通过关系 Transformer 实现主体条件化的跨视角关系预测,无需逐场景优化或已知相机位姿。文章同时基于 ScanNet++ 与 VLM/LLM 提供全自动标注管线,以支持该任务的可扩展训练数据生成。NeurIPS 2026 接收(海报)。

来源:arXiv · Computer Vision · arxiv.org