论文

FreqDoor:频域中的隐藏木马,用于对视觉语言模型进行后门攻击

FreqDoor: A Hidden Trojan in the Frequency Domain for Backdoor Attacks on Vision-Language Models

模型评测安全与风险评测

摘要

视觉语言模型(VLM)最近在开放式图像到文本生成方面取得了巨大进展。然而,它们的多模式性质使它们始终容易受到后门攻击。现有的 VLM 后门触发器是空间的、文本的或双模的,这可能会产生局部或可识别的触发模式。在这项工作中,我们探索了不同的攻击面并提出了 \textsc {FreqDoor},一种在频域中植入触发器的训练时后门攻击。 \ textsc {FreqDoor} 有选择地混合来自触发源图像的幅度频谱分量,同时保留干净图像的相位,以生成空间分布且视觉上难以察觉的触发器,而无需修改文本输入。我们评估了对 BLIP-2、InstructBLIP 和 LLaVA 的攻击,以实现图像字幕和视觉问答。在 Flickr8k 上,\textsc {FreqDoor} 在三个模型上分别实现了 $99.6\%$、$99.8\%$ 和 $98.4\%$ 的攻击成功率,同时保留了生成的字幕的语义质量。在VQAv2上,相应的攻击成功率为$99.6\%$、$92.4\%$和$79.6\%$。