论文

SafeGene:面向可迁移安全对齐的可复用适配器

SafeGene: Reusable Adapters for Transferable Safety Alignment

模型训练参数高效训练

摘要

开放权重的大语言模型越来越多地被微调为定制助理,但下游微调可能会削弱安全性,并使模型更容易受到恶意提示的影响,即使训练数据不是故意有害的。当目标模型使用新任务数据或用户交互反复更新时,这会产生反复出现的安全恢复问题。我们提出了 SafeGene,这是一种可重复使用的安全适配器模块,专为在每个架构兼容的模型系列中跨任务重复使用而设计。 SafeGene 并未将安全恢复视为特定于模型的修复步骤,而是将安全功能视为与特定于任务的更新分离的独立、可重用的适配器表示。这种表示是从对齐的降级模型差异中获得的,通过数据感知层选择细化为可转移的任务安全向量,并通过几次逐层系数重新校准在每个下游任务适应模型中表示。跨多个模型系列、下游任务和安全判断的实验表明,SafeGene 增强模型在保持下游性能的同时降低了有害响应率,在安全-效用权衡方面优于代表性的安全适应方法。

SafeGene:面向可迁移安全对齐的可复用适配器:论文配图
图 1:SafeGene 的动机。对新收集的数据进行持续微调可以提高下一代模型的实用性,但可能会削弱安全性。在每个架构兼容的模型系列中,SafeGene 模块从可重用的安全向量中实例化一次,并通过几次重新校准在不断发展的下游任务适应模型中重用,从而在保留任务效用的同时恢复安全性。