论文

多语言视觉语言大型模型的有针对性的可解释安全神经元增强

Targeted Interpretable Safety Neuron Enhancement for Multilingual Vision-Language Large Models

模型训练参数高效训练

摘要

随着视觉语言大型模型(VLLM)的广泛部署,其安全性面临着跨语言和模式的双重挑战。现有方法分别对多语言和多模式安全进行建模,忽视了低资源语言指令和视觉上下文之间的耦合风险,这阻碍了跨语言和跨模式有害意图的检测以及稳健安全边界的形成。为了解决这个问题,我们提出了一个神经元级可解释的安全对齐框架,该框架可以识别安全神经元并执行针对神经元的安全调整,以共同减轻多语言和多模式风险。具体来说,我们比较有害请求和良性输入引起的 FFN 表示,以确定与安全拒绝相关的神经元激活强度。接下来,我们联合对神经元激活和相应的下投影列进行建模,以导出神经元级别的显着性,将一般的多语言和多模式神经元与负责模型防御的安全神经元分开。最后,针对神经元的梯度掩蔽将参数更新限制在已识别神经元跨越的安全子空间中,从而实现精确且可解释的安全增强。大量实验表明,我们的方法通过仅调整少数安全神经元来增强多语言和多模式安全性,同时保留一般功能。