论文
隐藏、重建、越狱:利用MLLM中的重建-隐藏权衡
Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs
摘要
针对多模态大语言模型 (MLLM) 的基于意图混淆的越狱攻击将有害查询转换为隐藏的多模态输入以绕过安全机制。我们表明,此类攻击受到\emph{重建-隐藏权衡}的控制:转换后的输入必须隐藏来自安全过滤器的有害意图,同时保持足够的可恢复性,以便受害者模型重建原始请求。通过对三种代表性黑盒方法的重构分析,我们发现现有的转换很难平衡这种权衡,限制了它们的有效性。相比之下,我们表明删除字符的变体实现了更好的平衡。在此基础上,我们提出了 \emph{隐藏感知变体构造},它贪婪地选择有害关键字对齐程度低且相互多样化的字符删除变体,并通过五种模态感知提示策略实例化它们。我们进一步引入 \emph{与关键字相关的干扰图像},它在不同的上下文中描述有害关键字,提供比通用干扰图像更有效的辅助视觉上下文。跨闭源和开源 MLLM 的实验表明,所提出的策略优于强大的基线,揭示了一个未被充分开发的漏洞:模型自身的重建能力可被利用来恢复隐藏的有害意图并产生不安全的响应。
