论文

隐藏、重建、越狱:利用MLLM中的重建-隐藏权衡

Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs

模型评测安全与风险评测

摘要

针对多模态大语言模型 (MLLM) 的基于意图混淆的越狱攻击将有害查询转换为隐藏的多模态输入以绕过安全机制。我们表明,此类攻击受到\emph{重建-隐藏权衡}的控制:转换后的输入必须隐藏来自安全过滤器的有害意图,同时保持足够的可恢复性,以便受害者模型重建原始请求。通过对三种代表性黑盒方法的重构分析,我们发现现有的转换很难平衡这种权衡,限制了它们的有效性。相比之下,我们表明删除字符的变体实现了更好的平衡。在此基础上,我们提出了 \emph{隐藏感知变体构造},它贪婪地选择有害关键字对齐程度低且相互多样化的字符删除变体,并通过五种模态感知提示策略实例化它们。我们进一步引入 \emph{与关键字相关的干扰图像},它在不同的上下文中描述有害关键字,提供比通用干扰图像更有效的辅助视觉上下文。跨闭源和开源 MLLM 的实验表明,所提出的策略优于强大的基线,揭示了一个未被充分开发的漏洞:模型自身的重建能力可被利用来恢复隐藏的有害意图并产生不安全的响应。

隐藏、重建、越狱:利用MLLM中的重建-隐藏权衡:论文配图
图 2:所提出的基于重构的越狱框架概述。从有害查询 xtx_{t} 开始,构建删除字符的候选,并选择一个多样化的、低关键字对齐子集 𝒱^​(xt)\hat{\mathcal{V}}(x_{t}) (§3.1),然后通过五种提示策略之一进行实例化,这些策略将转换后的信息分布在文本和图像模式中 (§3.2)。对于基于 GDI 的策略(TxtV-GDI、TTV-GDI),与关键字相关的干扰图像 𝒟⁡(xt)\mathcal{D}(x_{t}) 是从有害关键字 ww 额外构建的,并组合成视觉输入(§3.3)。生成的多模态输入 (x^t,x^v)(\hat{x}_{t},\hat{x}_{v}) 被传递给受害者 MLLM FθF_{\theta} 并由判断模型进行评估。