论文

每张图片都讲述一个危险的故事:针对VLM的记忆增强多智能体越狱攻击

Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs

模型评测上下文与知识记忆安全与风险评测Agent记忆

摘要

视觉语言模型(VLM)的快速发展催生了人工智能前所未有的能力;然而,这种持续的模式扩展无意中暴露了一个大大扩大且不受约束的对抗攻击面。当前的多模态越狱策略主要关注表面像素扰动和排版攻击或有害图像;然而,它们无法处理视觉数据固有的复杂语义结构。这使得原始、自然图像的巨大语义攻击面在很大程度上不受审查。在暴露这些深层语义漏洞的需求的驱动下,我们引入了 \textbf{MemJack},这是一个 \textbf{MEM}ory 增强的多代理 \textbf{JA}ilbreak atta\textbf{CK} 框架,它显式地利用视觉语义来编排自动越狱攻击。 MemJack 采用协调的多智能体协作来动态地将视觉实体映射到恶意意图,通过多角度视觉语义伪装生成对抗性提示,并利用迭代零空间投影 (INLP) 几何过滤器来绕过过早的潜在空间拒绝。通过持久的多模态经验记忆积累和转移成功策略,MemJack 在不同图像之间保持高度连贯的扩展多轮越狱攻击交互,从而提高新图像的攻击成功率(ASR)。对完整、未经修改的 COCO val2017 图像进行的广泛实证评估表明,MemJack 相对于 Qwen3-VL-Plus 实现了 71.48% 的 ASR,在扩展预算下可扩展至 90%。此外,为了促进未来的防御对齐研究,我们将发布 \textbf{MemJack-Bench},这是一个包含超过 113,000 个交互式多模态越狱攻击轨迹的综合数据集,为开发本质上稳健的 VLM 奠定了重要基础。

每张图片都讲述一个危险的故事:针对VLM的记忆增强多智能体越狱攻击
图 1. Comparison of VLM jailbreak paradigms.现有的攻击使用 (a) 文本操作、(b) 视觉干扰、(c) 印刷或 (d) 有害图像。 (e) 我们的 MemJack 通过多智能体视觉语义伪装和记忆增强反射来利用原始自然图像。