论文
ATAAT:针对视觉-语言-动作模型后门攻击的自适应威胁感知对抗性调整框架
ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action Models
摘要
为了解决视觉-语言-动作 (VLA) 模型中不断升级的安全漏洞,本研究调查了针对视觉通路的后门攻击。我们确定了导致传统攻击范式失败的一个核心障碍:“梯度干扰”。这种现象代表了端到端训练期间策略冲突引发的优化失败。为了解决这个问题,我们提出了自适应威胁感知对抗性调整(ATAAT)框架。 ATAAT通过其核心的“威胁方法自适应映射”机制,根据对手的能力智能选择最优的梯度解耦策略。大量实验表明,ATAAT 具有显着的优势,实现了高度鲁棒的定向攻击成功率(TASR > 80%),同时保持了极高的隐秘性,中毒率仅为 5%。它高效处理复杂的语义级触发,首次实现数据中毒场景下的隐式解耦攻击。这项工作揭示了 VLA 中的一个关键安全漏洞,并为未来的防御架构提供了理论和方法支持。