arXiv · Robotics· Yixuan Jiang, Wentong Li, An Liu, Zihao Xin, Fulin Tang, Cong Leng, Yang Gao, Jian Cheng·· 16 小时前AI 评分27
GeoScaffold:通过重建学习紧凑几何潜变量,提升视觉语言导航效率
GeoScaffold: Learning Compact Geometric Latents via Reconstruction for Efficient Vision-Language Navigation
AI 导读
GeoScaffold 是一种几何监督框架,把深度、连通性、可通行性等几何信息在训练时内化到策略中,避免推理时依赖深度传感器、3D 编码器或逐步感知工具调用。它先学习并冻结一个紧凑深度 tokenizer,再用少量可学习几何 query token 的隐藏状态重建导航关键几何,训练后 tokenizer、目标生成器和重建头全部丢弃,仅保留主干与动作接口。
来源:arXiv · Robotics · arxiv.org