论文
通过基于梯度的样本选择持续安全调整
Continual Safety Alignment via Gradient-Based Sample Selection
摘要
大语言模型 需要不断适应新任务,同时保持安全对齐。然而,即使是良性数据的 微调 也常常会损害安全行为,包括拒绝有害请求、真实性和常识推理。我们通过以数据为中心的视角来调查哪些训练样本会导致对齐漂移。我们的实证分析表明,样本的贡献是不平等的:高梯度样本会导致更大的安全性下降,并驱动模型走向预训练分布,而中等梯度样本则能够以最小的对齐损失进行任务学习。我们提出基于梯度的样本选择,在 微调 期间过滤高梯度样本。在连续域任务的多个模型系列中,我们的方法显着改善了对齐保留,同时保持有竞争力的任务性能,而不需要策划的安全数据或架构修改。我们的方法在选择比、任务顺序和不同的攻击基准方面都很稳健。