论文

SafeSteer:面向多模态大语言模型的解码级防御机制

SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models

模型推理解码与生成控制

摘要

多模态大语言模型(MLLM)正受到越来越多的关注。由于其输入特征的异构性,MLLM在越狱防御方面面临重大挑战。现有防御方法依赖成本高昂的微调或低效的事后干预,限制了应对新型攻击的能力,并涉及性能权衡。为解决上述问题,我们探索MLLM内部固有的安全能力,并量化其在解码阶段辨别有害性的内在能力。我们观察到:1) MLLM能在解码过程中区分有害与无害输入;2) 基于图像的攻击更为隐蔽。基于这些洞见,我们提出SafeSteer,一个面向MLLM的解码级防御机制。具体而言,它包括Decoding-Probe,一个在解码过程中检测并纠正有害输出的轻量探针,可迭代地将解码过程引向安全方向。此外,还集成了一个模态语义对齐向量,将强大的文本安全对齐迁移到视觉模态。在多个MLLM上的实验表明,SafeSteer无需微调即可将MLLM的安全性最多提升33.40%。值得注意的是,它能保持MLLM的有效性,确保其有用性与无害性之间的平衡。

SafeSteer:面向多模态大语言模型的解码级防御机制:论文配图
图 1:近期防御和 SafeSteer 的示例: a) 输入/输出干预重写输入/输出,导致过度安全。 b) 通过设计的数据集微调训练 MLLM,但无法解决新的攻击。 c) SafeSteer利用MLLM固有的安全能力在解码过程中逐步纠正生成过程。