论文
SafeSteer:面向多模态大语言模型的解码级防御机制
SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models
摘要
多模态大语言模型(MLLM)正受到越来越多的关注。由于其输入特征的异构性,MLLM在越狱防御方面面临重大挑战。现有防御方法依赖成本高昂的微调或低效的事后干预,限制了应对新型攻击的能力,并涉及性能权衡。为解决上述问题,我们探索MLLM内部固有的安全能力,并量化其在解码阶段辨别有害性的内在能力。我们观察到:1) MLLM能在解码过程中区分有害与无害输入;2) 基于图像的攻击更为隐蔽。基于这些洞见,我们提出SafeSteer,一个面向MLLM的解码级防御机制。具体而言,它包括Decoding-Probe,一个在解码过程中检测并纠正有害输出的轻量探针,可迭代地将解码过程引向安全方向。此外,还集成了一个模态语义对齐向量,将强大的文本安全对齐迁移到视觉模态。在多个MLLM上的实验表明,SafeSteer无需微调即可将MLLM的安全性最多提升33.40%。值得注意的是,它能保持MLLM的有效性,确保其有用性与无害性之间的平衡。
