论文
当图像思考遇到安全时:什么决定了多模式越狱的稳健性?
When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?
摘要
图像思考推理正在成为大型视觉语言模型的新推理范式,但其安全影响仍然知之甚少。现有系统已经跨越多种流程设计,包括直接响应生成、纯文本优先转向、视觉状态操作和显式外部图像工具调用。在本文中,我们询问哪些评估范例可以提高多模式越狱的鲁棒性,以及原因。在我们的实验中,在多个视觉语言模型中,显式图像工具交互产生的攻击成功率最低,在评估的模型中相对平均而言,越狱成功率降低了约 30%。这一发现最初令人惊讶:即使返回的图像工具输出被手动覆盖或本身看起来不安全,ASR 仍然很低,但在纯文本优先转弯控制下返回接近直接应答水平。这些结果表明,较低的 ASR 不能通过良性返回图像语义或单独的文本图像工具跟踪来解释。为了解释该模式,我们引入了一个图像工具安全向量框架,该框架将图像工具调用建模为隐藏表示中向安全相关方向的残余移位。表征层面的分析和激活干预支持了这一说法。总的来说,我们的结果表明,显式图像工具交互是一种有前途的设计模式,可以提高越狱的鲁棒性,同时也可以促进特定于管道的安全评估。