论文
难以阅读,容易越狱:视觉退化如何绕过 MLLM 安全对齐
Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment
摘要
视觉上下文压缩方面的最新进展使 MLLM 能够通过将文本渲染为图像来有效地处理超长上下文。然而,我们发现了这种模式固有的一个关键漏洞:降低图像分辨率会无意中催化越狱。我们的实验表明,随着分辨率的降低,SOTA 模型的安全防御能力急剧恶化,甚至在文本保持清晰的情况下仍然令人惊讶地持续存在。我们将此归因于“认知超载”,假设破译降级输入所需的努力会转移安全审计的注意力资源。这种现象在各种视觉扰动(包括噪声和几何失真)中都是一致的。为了解决这个问题,我们提出了一种简单的“结构化认知卸载”策略,通过强制执行序列化管道将视觉转录与安全评估分离来减轻这些风险。我们的工作揭示了基于视觉的压缩中的重大风险,并为未来 MLLM 的安全设计提供了重要的见解。