跳到正文
原文
arXiv · Robotics· Jasper Gerigk, Kenzo Aspuru-Takata, Chin-Hsuan Wu, Mohammad Mohammadi, Shuhong Zheng, Igor Gilitschenski·· 3 小时前AI 评分33

当倾听变得更容易:清除视觉线索以实现无捷径的 VLA 模型

When Listening Becomes Easier: Scrubbing Visual Cues for Shortcut-Free VLAs

AI 导读

研究者针对机器人学习中的捷径学习问题,提出任务擦除(task scrubbing)这一新的域对抗训练方法,以降低 VLA 模型对视觉捷径的依赖并提升泛化能力。研究发现不同视觉-语言模型骨干对视觉捷径学习的易感性差异显著,并提出无需策略回滚的表征级指标 action margin 来衡量该行为。在仿真与真实世界多个 VLA 模型上的实验表明,该方法提升了分布外鲁棒性,并常能消除视觉捷径学习。

来源:arXiv · Robotics · arxiv.org