论文

CSULoRA:最近安全更新低秩适应

CSULoRA: Closest Safe Update Low-Rank Adaptation

模型训练模型编辑与遗忘

摘要

低秩自适应已成为 大语言模型 的参数高效 微调 的标准方法,但即使少量的不安全或对抗性 微调 数据也可能大大削弱对齐模型的安全行为。现有的保护安全的 LoRA 方法通常依赖于硬干预,例如投影、修剪、阈值或额外的训练目标。虽然这些方法可以抑制不安全的更新方向,但它们也可能会删除与任务相关的信息或需要额外的调整。我们引入了 CSULoRA,这是一种事后方法,用于通过最接近的安全更新估计来纠正经过训练的 LoRA 适配器。 CSULoRA 根据安全对齐模型与其相应的基础检查点之间的权重位移来估计安全对齐子空间。然后,它将每个 LoRA 更新分解为完全对齐、部分对齐和子空间外组件。 CSULoRA 不是丢弃估计安全子空间之外的组件,而是解决了封闭形式的惩罚最小变化问题,该问题保留了完全对齐的组件,同时根据其相对能量平滑地衰减了潜在的不安全方向。在对抗性 微调 实验中,CSULoRA 大幅降低了攻击成功率,同时保留了从标准 LoRA 微调 获得的大部分效用增益。