论文
CBV:经扩散模型对视觉语言模型的干净标签后门攻击
CBV: Clean-label Backdoor Attacks on Vision Language Models via Diffusion Models
摘要
视觉语言模型(VLM)在图像描述与视觉问答(VQA)等任务上取得显著成功。但随着应用日益广泛,近期研究揭示VLM易受后门攻击。现有VLM后门攻击主要依赖数据投毒:添加视觉触发器并修改文本标签,由此造成的图文失配使投毒样本易被检测。为解决这一局限,我们提出经扩散模型对VLM的干净标签后门攻击(CBV),利用扩散模型经分数匹配生成自然的投毒样本。具体而言,CBV在扩散模型反向生成过程中修改分数,引导生成含触发图像特征的投毒样本。为进一步提升攻击有效性,我们在生成过程中引入触发图像的文本信息作为多模态引导。此外,为增强隐蔽性,我们提出GradCAM引导掩码(GM),把修改限制在语义最重要的区域而非整图。我们在MSCOCO与VQA v2上以四个代表性VLM评估,实现超过80%的攻击成功率(ASR)同时保持正常功能。
