论文
通过涂鸦和跨语言触发器对自动驾驶 VLM 进行多模式后门攻击
Multimodal Backdoor Attack on VLMs for Autonomous Driving via Graffiti and Cross-Lingual Triggers
摘要
视觉语言模型(VLM)正在迅速集成到自动驾驶等安全关键系统中,使其成为潜在后门攻击的重要攻击面。现有的后门攻击主要依赖单模态、显式且易于检测的触发方式,难以在自动驾驶场景下构建既隐蔽又稳定的攻击通道。 GLA 引入了两种自然触发器:通过稳定扩散修复生成的基于涂鸦的视觉模式,它无缝地融入城市场景;跨语言文本触发器,它引入分布变化,同时保持语义一致性,以构建强大的语言端触发信号。 DriveVLM 上的实验表明,GLA 只需要 10% 的中毒率即可实现 90% 的攻击成功率(ASR)和 0% 的误报率(FPR)。更阴险的是,后门并没有削弱干净任务上的模型,而是改进了 BLEU-1 等指标,使得传统的基于性能下降的检测方法难以识别攻击。这项研究揭示了自动驾驶 VLM 中被低估的安全威胁,并为安全关键型多模式系统中的后门评估提供了一种新的攻击范例。