论文
自动驾驶黑盒视频语言模型的时空一致攻击
Transferable Spatial Temporal Coherence Adversarial Attack on Black-Box Vision Language Models for Autonomous Driving
摘要
视觉语言模型 (VLM) 快速集成到敏感系统中引入了现有研究中尚未探索的关键安全漏洞。虽然针对基于图像的模型的对抗性攻击鲁棒性已得到广泛研究,但 VLM 对驾驶环境中视频的时间感知对抗性攻击的敏感性构成了明显且未经检查的威胁。在本文中,我们介绍了针对自动驾驶场景中使用的 VLM 模型的视频的新型对抗性攻击,称为空间时间相干性对抗攻击(STCA)。我们的攻击包括三个阶段:模态扩展、空间攻击和 STCA 攻击。在模态扩展中,我们提出了标题引导的帧选择方法,以确保对抗性扰动针对语义上最重要的帧。其次,在空间攻击中,我们精心设计了有效的扰动并保持了较高的相似性。然后,生成的扰动视频被输入 STCA 阶段,使用运动引导掩模破坏跨帧时间一致性。我们的方法在针对受害者目标 VLM 的黑盒威胁模型下运行,仅依赖于白盒 代理模型 模型的可转移性。我们在三个 VLM 模型的 BDD100K 和 nuScenes 自动驾驶数据集上进行实验:Video LLaVA-7B、Qwen2.5-VL-7B 和 Dolphin。实验结果表明,空间攻击实现了具有高 SSIM 的 ASR。我们的研究结果表明,现有的视频语言模型在自动驾驶场景中仍然极易受到对抗性攻击,这凸显了对 VLM 模型进行稳健防御的迫切需要。
