论文
禁止你的注意力:通过选择性地消除谱域中的内在焦点来欺骗多模态 大语言模型
Forbid Your Attention: Fooling Multimodal Large Language Models by Selectively Removing Intrinsic Focus in Spectral Domain
摘要
多模态 大语言模型 (MLLM) 扩展了 大语言模型 (LLM) 的能力来处理更多上下文多模态信息,在各种实际多模态应用中显示出显着进展。尽管 MLLM 具有很强的感知和推理能力,但最近的研究表明,MLLM 仍然非常容易受到对抗性输入的影响,尤其是那些针对视觉组件的输入。然而,现有的攻击主要集中在全局扰动上,缺乏对 MLLM 内部如何解释视觉结构的理解。在本文中,我们尝试研究频域中 MLLM 的内在焦点,并发现它们的预测对编码基本结构和语义线索的相位信息特别敏感。基于这一观察,我们提出了一种新颖的相感知对抗性攻击框架,该框架明确地将对抗性扰动限制在与结构相关的相区域,以抑制 MLLM 对有效且难以察觉的攻击的关注。为了进一步放大结构影响,我们还引入了辅助对抗性提示学习模块来引导相敏区域周围的多模态错位,从而误导 MLLM 对目标结构模式的注意力。对多个代表性 MLLM 模型和数据集的广泛实验证明了我们的方法与现有攻击相比具有卓越的有效性。