论文

通过拒绝别名减少消除

Abliteration Mitigation via Refusal Aliases

模型训练模型编辑与遗忘

摘要

消除,即通过投影与提取的拒绝方向正交的权重矩阵来从 大语言模型 中删除拒绝功能,由于其仅使用一小组对比提示即可绕过 后训练 对齐的能力,已成为一个突出的安全问题。我们发现现有的防御措施通常忽视了消除的原因;也就是说,提取拒绝方向的容易程度。为了阻碍这一过程,我们引入了一种权重编辑方法,该方法通过对残差流写入器矩阵应用rank-$k$更新来模糊拒绝信号,同时用随机别名替换导致拒绝的激活,并纠正下游读取器矩阵以保留模型的原始行为。在 Llama-3-8B 上,AMRA 将消除后拒绝分数比无防御基线提高了 2.16 美元点,且 MMLU 降级不到 0.5 美元百分点。在 Gemma-2-9B 上,它使消除后的拒绝率比基线提高了 14.70 美元点,同时保持有害输出率与基线相似,尽管公用事业成本更高。