arXiv · Robotics· Jiayu Chen, Shuyong Gao, Jingkai Jia, Xiaosheng Bu, Jiyuan Fu, Lingyi Hong, Kaixun Jiang, Yipan Xu, Wenqiang Zhang·· 6 小时前AI 评分36
Beyond Token Importance:保留空间骨架以实现高效视觉-语言-动作推理
Beyond Token Importance: Preserving Spatial Scaffolds for Efficient Vision-Language-Action Inference
AI 导读
现有 VLA 剪枝策略主要按任务语义相关性选择视觉 token,忽略机器人操作所需的空间信息。研究提出 GeoScaffold,一种无需训练的视觉 token 剪枝方法,将图像划分为空间区域,按任务相关性权重分配区域间 token 预算,并通过最远点采样选择区域内骨架 token。
来源:arXiv · Robotics · arxiv.org