论文

SafeNexus:发现和引导 MLLM 中的通用安全神经元

SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs

模型训练模型编辑与遗忘

摘要

尽管 大语言模型 (LLM) 已表现出有希望的安全性能,但将其扩展到多模式 大语言模型 (MLLM) 暴露了扩展的多模式功能与现有安全机制之间的显着差距。当前的防御仍然主要局限于特定的模式设置,从而限制了它们针对更广泛的跨模式威胁的鲁棒性。为了弥补这一差距,我们引入了 SafeNexus,这是一种跨模式安全调整框架,采用专用的神经元级干预策略。首先,我们制定了一种神经元定位范式,通过表征中间层激活模式并通过重要性评分量化其功能显着性来识别功能专门的神经元。在此范式的基础上,我们利用对比数据来识别模态绑定的安全神经元(BS-Neurons),并通过有针对性的抑制来验证它们在调节每种模态中的安全行为中的作用。进一步的跨模态分析将模态通用安全神经元(US-Neurons)定义为跨个体模态识别的 BS-Neurons 的共享子集,作为防御有害跨模态攻击的核心。我们观察到,抑制这些神经元会大大降低各种模式的安全性能,而整体效用基本上不受影响。基于这些见解,我们提出了两种安全调整策略:激活级安全放大器和安全神经元校准器。所提出的策略通过两种不同的途径增强模型安全性:前者放大 US-Neurons 的激活幅度,而后者通过有针对性的 微调 有选择地校准它们。大量的实验表明,我们的方法在跨越不同模态组合的安全基准上优于主流的最先进方法,同时有效地保留了实用性。