论文
一个锚点适用所有:面向LVLM的统一多语言与多模态安全对齐
One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs
摘要
随着大型视觉语言模型(LVLM)在全球范围部署,多语言指令与视觉信息的结合使恶意攻击比以往更加隐蔽和复杂。然而,现有方法将语言与模态防御割裂开来,加之安全数据稀缺、微调成本高昂,使模型难以抵御复合攻击。为应对这一严峻挑战,我们提出一个由模态与语言共享安全神经元(MLS-Neurons)驱动的神经元级跨维度安全对齐框架。首先,我们通过比较模型对有害样本与良性样本的响应来识别单语和单模态安全神经元,并通过激活强度与下游影响量化功能显著性。然后,通过在每个语言内部对这些单模态神经元取交集,我们提取对视觉与文本风险都有响应的模态共享安全神经元(MS-Neurons),弥合模态之间的安全表征差距。进而,以英语为语义锚点,我们对跨语言的MS-Neurons取交集,识别出模态与语言共享安全神经元(MLS-Neurons),作为抵御复合攻击的关键防线。最后,我们仅更新这一极小的共享神经元子集(约占参数的0.03%),将仅英语的安全监督迁移到多语言与多模态场景。大量实验表明,我们的方法在多样的多语言与多模态安全基准上显著优于现有最先进方法,同时保持通用能力。
