论文
Phantasia:视觉语言模型中的上下文自适应后门
Phantasia: Context-Adaptive Backdoors in Vision Language Models
摘要
视觉语言模型(VLM)的最新进展极大地增强了视觉感知和语言推理的整合,推动了多模态理解的快速进步。尽管取得了这些成就,但 VLM 的安全性,特别是其对后门攻击的脆弱性,仍然没有得到充分的研究。现有的针对 VLM 的后门攻击仍处于开发的早期阶段,当前大多数方法依赖于生成包含固定的、易于识别的模式的有毒响应。在这项工作中,我们做出了两项关键贡献。首先,我们首次证明现有 VLM 后门攻击的隐蔽性被大大高估了。通过采用最初为其他领域设计的防御技术(例如,仅视觉和仅文本模型),我们表明可以轻松地检测到几种最先进的攻击。其次,为了解决这一差距,我们引入了 Phantasia,这是一种上下文自适应后门攻击,可以动态地将其中毒输出与每个输入的语义对齐。 Phantasia 鼓励模型生成上下文连贯但仍然可信的恶意响应,而不是产生静态的中毒模式,从而显着提高隐秘性和适应性。跨不同 VLM 架构的大量实验表明,Phantasia 实现了最先进的攻击成功率,同时在各种防御设置下保持良好的性能。