论文
通过耦合权重与激活约束防止大语言模型的安全漂移
Preventing Safety Drift in Large Language Models via Coupled Weight and Activation Constraints
摘要
大语言模型(LLM)的安全对齐在微调过程中仍然高度脆弱,即使良性适配也可能削弱预训练的拒绝行为并产生有害回应。现有防御通常单独约束权重或激活,未考虑二者对安全的耦合效应。本文首先从理论上证明,单独约束权重或激活都不足以保全安全性。为稳健地保全安全对齐,我们提出耦合权重与激活约束(Coupled Weight and Activation Constraints, CWAC),该方法同时在权重更新上强制执行预计算的安全子空间,并对由稀疏自编码器识别的安全关键特征施加针对性正则化。在四个广泛使用的LLM和多样下游任务上的大量实验表明,CWAC始终取得最低有害分数,对微调准确率影响极小,即使在高有害数据比例下也大幅超越强基线。
