论文

通过物理可部署的多模态语义照明攻击挑战视觉语言模型

Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks

模型评测安全与风险评测

摘要

视觉语言模型 (VLM) 已显示出卓越的性能,但其安全性仍未被充分了解。现有的对抗性研究几乎完全集中在数字环境上,而很大程度上没有探索物理世界的威胁。随着 VLM 越来越多地部署在现实环境中,这种差距变得至关重要,因为对抗性扰动必须在物理上是可实现的。尽管存在这种实际意义,但针对 VLM 的物理攻击尚未得到系统研究。此类攻击可能会导致识别失败并进一步破坏多模态推理,从而导致下游任务中严重的语义误解。因此,调查对 VLM 的物理攻击对于评估其现实世界的安全风险至关重要。为了弥补这一差距,我们提出了多模态语义照明攻击(MSLA),这是第一个针对 VLM 的物理可部署对抗攻击框架。 MSLA 使用可控对抗性照明来破坏真实场景中的多模态语义理解,攻击语义对齐而不仅仅是特定于任务的输出。因此,它降低了主流 CLIP 变体的零样本分类性能,同时在图像字幕和视觉问答 (VQA) 中的 LLaVA 和 BLIP 等高级 VLM 中引发严重的语义幻觉。数字和物理领域的大量实验证明 MSLA 是有效的、可转移的并且实际上是可实现的。我们的研究结果提供了第一个证据,证明 VLM 非常容易受到物理可部署语义攻击,暴露了之前被忽视的鲁棒性差距,并强调了对 VLM 的物理世界鲁棒性评估的迫切需要。