论文
不存在单一失效神经元:抵御白盒攻击的分布式安全对齐
No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks
摘要
随着大规模基础模型的快速发布,安全威胁从黑盒的逃脱转变为神经元级别的白盒攻击,这些攻击直接识别和操纵与安全相关的神经元。现有的对齐方法通常仅在少数神经元上进行安全行为的研究,导致脆弱的单点故障,缺乏冗余。为解决这一问题,我们提出分布式安全对齐(DSA),它在多个计算神经元上冗余地编码安全能力,确保即使关键的安全神经元被破坏,模型也能保持其安全基准。具体来说,我们将干预集中在语言侧前馈网络中的下投影层的输入上,将每个特征坐标视为个体神经元的激活。然后,DSA将神经元激活与损失梯度结合,计算一个全局识别当前模型拒绝行为的导向第一阶泰勒分数。最后,通过确定性掩码和随机dropout进行定向破坏,迫使模型放弃狭窄的安全神经元,并冗余地编码安全行为在多个补偿性神经元上。广泛的实验结果表明,DSA显著提高了对抗白盒神经元级别的安全攻击的鲁棒性,同时保留了模型的通用语言和多模态实用性。
