arXiv · Robotics· Yukiya Horiba, Koshiro Aoki, Shunsuke Yasuki, Bum Jun Kim, Taiki Miyanishi·· 16 小时前AI 评分24
Detect and Suppress:针对 VLA 模型对抗补丁的机制化防御
Detect and Suppress: A Mechanistic Defense against Adversarial Patches in VLA Models
AI 导读
研究用稀疏自编码器(SAE)机制化分析 VLA 表征,识别出与对抗补丁存在强相关的特征,并仅在线性探针检测到攻击时于推理阶段抑制该特征。该方法无需微调 VLA,在 LIBERO-10 上评估显示间歇性干预可提升攻击下成功率,而持续施加同一干预会显著降低策略性能。结果表明攻击相关内部表征可作为 VLA 对抗防御靶点,干预时机对避免干扰正常策略行为至关重要。
来源:arXiv · Robotics · arxiv.org