跳到正文
原文
arXiv · Robotics· Jiayu Chen, Shuyong Gao, Jingkai Jia, Xiaosheng Bu, Jiyuan Fu, Lingyi Hong, Kaixun Jiang, Yipan Xu, Wenqiang Zhang·· 6 小时前AI 评分36

Beyond Token Importance:保留空间骨架以实现高效视觉-语言-动作推理

Beyond Token Importance: Preserving Spatial Scaffolds for Efficient Vision-Language-Action Inference

AI 导读

现有 VLA 剪枝策略主要按任务语义相关性选择视觉 token,忽略机器人操作所需的空间信息。研究提出 GeoScaffold,一种无需训练的视觉 token 剪枝方法,将图像划分为空间区域,按任务相关性权重分配区域间 token 预算,并通过最远点采样选择区域内骨架 token。

来源:arXiv · Robotics · arxiv.org