论文

不存在单一失效神经元:抵御白盒攻击的分布式安全对齐

No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks

模型训练监督微调与指令调优

摘要

随着大规模基础模型的快速发布,安全威胁从黑盒的逃脱转变为神经元级别的白盒攻击,这些攻击直接识别和操纵与安全相关的神经元。现有的对齐方法通常仅在少数神经元上进行安全行为的研究,导致脆弱的单点故障,缺乏冗余。为解决这一问题,我们提出分布式安全对齐(DSA),它在多个计算神经元上冗余地编码安全能力,确保即使关键的安全神经元被破坏,模型也能保持其安全基准。具体来说,我们将干预集中在语言侧前馈网络中的下投影层的输入上,将每个特征坐标视为个体神经元的激活。然后,DSA将神经元激活与损失梯度结合,计算一个全局识别当前模型拒绝行为的导向第一阶泰勒分数。最后,通过确定性掩码和随机dropout进行定向破坏,迫使模型放弃狭窄的安全神经元,并冗余地编码安全行为在多个补偿性神经元上。广泛的实验结果表明,DSA显著提高了对抗白盒神经元级别的安全攻击的鲁棒性,同时保留了模型的通用语言和多模态实用性。

不存在单一失效神经元:抵御白盒攻击的分布式安全对齐:论文配图
图2:分布式安全对齐(DSA)的整体框架。DSA 使用方向感知的泰勒得分定位核心拒绝神经元,然后在重新对齐时有针对性地应用掩蔽和随机丢弃。联合优化使这种结构化扰动促使模型在可补偿的神经元之间冗余编码安全信息。