arXiv · Robotics· Junmyeong Lee, Dongmin Shin, Min-Gyu Park, Wooseok Jeon, Inho Chang, Hae-Gon Jeon·· 3 小时前AI 评分29
WARP-VLA:面向视觉-语言-动作模型的手腕相机适配与视角鲁棒策略执行
WARP-VLA: Wrist-Camera Adaptation for View-Robust Policy Execution in Vision-Language-Action Models
AI 导读
研究者提出 WARP-VLA,一种适配多种手腕相机配置的视角鲁棒 VLA 模型。它采用 Mixture-of-Experts(MoE)架构,由各专家学习视角特定特征变换、路由器依据隐式视角信息组合,部署时无需输入相机外参。
来源:arXiv · Robotics · arxiv.org