论文

重载大型视觉语言模型以进行越狱

Overloading Large Vision-Language Models for Jailbreaking

模型评测安全与风险评测

摘要

大型视觉语言模型 (LVLM) 展现出卓越的视觉语言功能,并且越来越多地部署在个人助理、文档分析系统和实体代理等现实世界应用中。然而,它们的双模式攻击面使它们容易受到越狱攻击。现有的 LVLM 越狱依赖于简单的设计,例如短文本和未发行的图像。然而,大语言模型 主干和多模式机制的最新进展破坏了这些攻击,特别是它们在模型架构之间的可转移性。为了克服这一限制,我们提出了一种新颖的信息重载方法,该方法配备了广泛的文本和多维图像攻击。这些组件以基于递归的图像排版布局排列,以指数方式增加多模态信息的复杂性。这种重载方法放大了所需的跨模式处理,从而破坏了 LVLM 中的安全对齐。对开源和商业 LVLM 的广泛实验使我们的方法成为一种新的最先进的 LVLM 越狱攻击。在开源模型上,我们的方法实现了 88.6% 的平均 ASR;在商业 LVLM 上,其平均 ASR 达到 84.0%,超出最佳基线 48.7%。此外,我们针对开源代理模型优化的提示可以在模型系列之间有效转移。除了实证结果之外,我们还探讨了受害 LVLM 内的安全关键信息流。我们的观察表明,复杂的图像排版组合会导致强化的跨模式处理,并降低模型生成拒绝响应的确定性。总之,这些发现强调信息过载是现实世界 LVLM 部署的一个实际和新兴的安全风险,强调需要针对复杂的多模式越狱输入采取更强有力的防御措施。