论文
检测并抑制:VLA模型对抗补丁的机制防御
Detect and Suppress: A Mechanistic Defense against Adversarial Patches in VLA Models
摘要
对抗补丁可通过操纵视觉观测干扰视觉-语言-动作(VLA)模型,导致机器人控制失败。但哪些内部机制构成这些失败、定向干预如何缓解,仍知之甚少。本工作用稀疏自编码器(SAE)机制分析VLA表示,识别出一个其激活与对抗补丁存在强相关的特征。基于该分析,仅在线性探针检测到攻击时在推理时抑制该特征。该干预无需微调VLA的成本即提升鲁棒性。我们在LIBERO-10的VLA对抗补丁攻击上评估:条件干预改善间歇攻击下的成功率,而持续施加同一干预会大幅降低策略性能。结果表明攻击相关的内部表示可为VLA对抗防御提供有用目标,且控制何时干预对限制对名义策略行为的干扰很重要。