论文

通过视觉模态越狱视觉语言模型

Jailbreaking Vision-Language Models Through the Visual Modality

模型评测安全与风险评测

摘要

视觉语言模型 (VLM) 的视觉形态是绕过安全对齐的未经充分探索的攻击面。我们介绍了利用视觉组件的四种越狱攻击:(1)使用解码图例将有害指令编码为视觉符号序列,(2)用良性替代品(例如,炸弹 -> 香蕉)替换有害对象,然后使用替代术语提示有害行为,(3)用良性单词替换图像中的有害文本(例如,书籍封面),同时视觉上下文保留原始含义,以及(4)视觉类比谜题,其解决方案需要推断禁止的概念。通过对六个前沿 VLM 进行评估,我们的视觉攻击绕过了安全对齐并暴露了跨模态对齐差距:基于文本的安全训练不会自动推广到视觉传达的有害意图。例如,我们的视觉密码在 Claude-Haiku-4.5 上的攻击成功率为 40.9%,而同等文本密码的攻击成功率为 10.7%。为了进一步了解攻击机制,我们提出了初步的可解释性和缓解结果。这些发现强调,稳健的 VLM 调整需要将视力视为一流的安全目标 后训练。