RelationVGGT 与 VASC:3D 空间关系分割与高效重建两篇 arXiv 论文
Get the story
2026-10-02 同日两篇 arXiv 论文发布。RelationVGGT 提出前馈、无姿态、多视角的 3D 空间关系分割框架,融合视觉与 3D 几何基础模型,通过关系 Transformer 实现主体条件化跨视角关系预测,无需逐场景优化或已知相机位姿,并基于 ScanNet++ 与 VLM/LLM 提供全自动标注管线,NeurIPS 2026 接收(海报)。VASC 提出无需训练的全局稀疏注意力方法,结合价值感知块选择与跨层记忆,在 7Scenes 和 NeuralRGB-D 上基于 VGGT 与 π³ 实验,相比 FasterVGGT 提升姿态估计与重建质量,推理速度最高达密集 VGGT 的 2.29×,代码已公开。两篇均来自计算机视觉领域。
Generated from reports · updated 2 hr ago
Developments
- Oct 2 · 1 reportsRelationVGGT: Visual Geometry Transformers for 3D Spatial RearXiv · Computer Vision: RelationVGGT:用于 3D 空间关系分割的视觉几何 Transformer
- Oct 2 · 1 reportsVASC:面向高效3D重建的价值感知稀疏注意力方法arXiv · Computer Vision: VASC:面向高效 3D 重建的价值感知稀疏注意力与跨层记忆
Timeline
Follow the coverage from different angles.
- arXiv · Computer VisionRelationVGGT:用于 3D 空间关系分割的视觉几何 Transformer
RelationVGGT 提出一种前馈式、无姿态、多视角的 3D 空间关系分割框架,将视觉基础模型语义特征与 3D 几何基础模型几何表示结合,并通过关系 Transformer 实现主体条件化的跨视角关系预测,无需逐场景优化或已知相机位姿。文章同时基于 ScanNet++ 与 VLM/LLM 提供全自动标注管线,以支持该任务的可扩展训练数据生成。NeurIPS 2026 接收(海报)。
- arXiv · Computer VisionVASC:面向高效 3D 重建的价值感知稀疏注意力与跨层记忆
VASC 是一种无需训练的全局稀疏注意力方法,结合价值感知的块选择与跨层记忆机制,在 7Scenes 和 NeuralRGB-D 上基于 VGGT 与 $\pi^3$ 实验,相比 FasterVGGT 提升姿态估计与重建质量,推理速度最高达密集 VGGT 的 $2.29\times$。代码已公开。
Heat trend
There is not enough continuous observation data to draw a trend yet.