论文

DIVA:利用跨步条件传播实现离散扩散视觉语言模型中的视觉越狱

DIVA: Exploiting Cross-Step Conditional Propagation for Visual Jailbreaks in Discrete Diffusion Vision-Language Models

模型评测安全与风险评测

摘要

大型视觉语言模型(VLM)越来越多地部署在安全关键的环境中,但现有的视觉越狱研究几乎完全集中在自回归架构上,而没有研究一个重要的新兴家族:多模态离散扩散视觉语言模型(dVLM)。我们发现了扩散生成特有的漏洞:因为视觉嵌入条件每个反向去噪步骤而不是充当一次性前缀,所以对抗性视觉语义在生成轨迹上重复传播和放大,我们将这种现象称为跨步骤条件传播。我们通过阶段敏感性分析、提示级别切换率和成对去噪箱分歧指标提供经验证据,并通过引导重采样确认。我们提出了 DIVA(离散扩散视觉语言模型攻击),这是一种使用跨模式意图混淆和扩散感知多时间步对抗优化的白盒视觉越狱框架。在三个 dVLM 中,DIVA 在 Beaver 奖励模型指标下达到 58.8%、67.7% 和 69.1% HADES ASR,优于为自回归模型设计的视觉越狱基线。代码:https://github.com/loststars2002/DIVA