论文
Mosaic:通过多视图集成优化针对闭源 VLM 进行多模式越狱
Mosaic: Multimodal Jailbreak against Closed-Source VLMs via Multi-View Ensemble Optimization
摘要
视觉语言模型 (VLM) 功能强大,但仍然容易受到多模式越狱攻击。现有的攻击主要依赖于显式视觉提示攻击或基于梯度的对抗性优化。虽然前者更容易检测,但后者会产生不易察觉的微妙扰动,但通常在同质开源代理目标设置下进行优化和评估,使其在异构设置下对商业闭源 VLM 的有效性尚不清楚。为了研究这个问题,我们研究了不同的替代目标设置,并观察到同质和异质设置之间存在一致的差距,我们将这种现象称为替代依赖性。受这一发现的启发,我们提出了 Mosaic,一种针对闭源 VLM 的多模式越狱的多视图集成优化框架,它通过减少对任何单一代理模型和视觉视图的过度依赖,减轻异构代理目标设置下的代理依赖性。具体来说,Mosaic 包含三个核心组件:文本端转换模块,它扰乱拒绝敏感的词汇模式;多视图图像优化模块,可更新不同裁剪视图下的扰动,以避免过度拟合单个视觉视图;代理集成指导模块,聚合来自多个代理 VLM 的优化信号,以减少代理特定偏差。关于安全基准的大量实验表明,Mosaic 针对商业闭源 VLM 实现了最先进的攻击成功率和平均毒性。