论文

CBV:经扩散模型对视觉语言模型的干净标签后门攻击

CBV: Clean-label Backdoor Attacks on Vision Language Models via Diffusion Models

模型训练合成数据

摘要

视觉语言模型(VLM)在图像描述与视觉问答(VQA)等任务上取得显著成功。但随着应用日益广泛,近期研究揭示VLM易受后门攻击。现有VLM后门攻击主要依赖数据投毒:添加视觉触发器并修改文本标签,由此造成的图文失配使投毒样本易被检测。为解决这一局限,我们提出经扩散模型对VLM的干净标签后门攻击(CBV),利用扩散模型经分数匹配生成自然的投毒样本。具体而言,CBV在扩散模型反向生成过程中修改分数,引导生成含触发图像特征的投毒样本。为进一步提升攻击有效性,我们在生成过程中引入触发图像的文本信息作为多模态引导。此外,为增强隐蔽性,我们提出GradCAM引导掩码(GM),把修改限制在语义最重要的区域而非整图。我们在MSCOCO与VQA v2上以四个代表性VLM评估,实现超过80%的攻击成功率(ASR)同时保持正常功能。

CBV:经扩散模型对视觉语言模型的干净标签后门攻击:论文配图
图 1:TrojVLM(Lyu 等人,2024)、BadToken(Bai 等人,2024)和来自 MSCOCO 的 CBV 中毒样本(Chen 等人,2015)的比较。在我们的方法中,中毒样品保留与干净样品相同的标签,从而实现更高的不可察觉性。