论文
GPO-V:通过全局概率优化的越狱扩散视觉语言模型
GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
摘要
扩散视觉语言模型 (dVLM) 建立在扩散 大语言模型 (dLLM) 的非因果基础之上,通过背离传统的自回归生成范式,在多模态任务中表现出了显着的功效。虽然 dVLM 本质上对传统越狱策略(我们将其归类为固定前缀优化 (FPO))(例如,用“当然,这里是”锚定响应)表现出强大的抵抗力,但这种感知的弹性是具有欺骗性的。我们对 dVLM 安全状况的调查揭示了一种独特的拒绝模式:立即拒绝和渐进拒绝。我们发现,虽然基于 FPO 的攻击通常会因触发后者而失败,但渐进式细化过程本身揭示了一种新颖的潜在攻击面。为了利用这个漏洞,我们提出了全局概率优化(GPO),这是一种专门为掩模扩散模型的去噪轨迹设计的通用越狱范例。与基于前缀的方法不同,GPO 操纵全局生成动力学来绕过扩散语言模型中的护栏。在此基础上,我们推出了 GPO-V,这是第一个专为 dVLM 量身定制的视觉模态越狱框架。实证结果表明,GPO-V 产生具有出色的跨模型可转移性的隐形扰动,揭示了非顺序生成架构中的关键安全漏洞。我们的研究结果强调了解决 dVLM 安全一致性问题的紧迫性。这些结果需要立即对当前的防御范式进行根本性的重新评估,以减轻基于扩散的生成的独特风险。我们的代码位于:https://anonymous.4open.science/r/GPO-V-0250。