论文

通过耦合权重与激活约束防止大语言模型的安全漂移

Preventing Safety Drift in Large Language Models via Coupled Weight and Activation Constraints

模型训练监督微调与指令调优

摘要

大语言模型(LLM)的安全对齐在微调过程中仍然高度脆弱,即使良性适配也可能削弱预训练的拒绝行为并产生有害回应。现有防御通常单独约束权重或激活,未考虑二者对安全的耦合效应。本文首先从理论上证明,单独约束权重或激活都不足以保全安全性。为稳健地保全安全对齐,我们提出耦合权重与激活约束(Coupled Weight and Activation Constraints, CWAC),该方法同时在权重更新上强制执行预计算的安全子空间,并对由稀疏自编码器识别的安全关键特征施加针对性正则化。在四个广泛使用的LLM和多样下游任务上的大量实验表明,CWAC始终取得最低有害分数,对微调准确率影响极小,即使在高有害数据比例下也大幅超越强基线。

通过耦合权重与激活约束防止大语言模型的安全漂移:论文配图
图 1:安全性下降的图示。给定一个有害的查询,激活漂移可能会导致模型绕过拒绝行为并以不相关的程序步骤进行响应(例如,做汤),而权重漂移则直接导致不安全的输出;我们的受保护模型限制激活和权重以保持安全行为。