论文
SafeSteer:面向高效安全对齐的局部同策略蒸馏
SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment
摘要
将大型语言模型 (LLM) 与人类价值观保持一致通常会降低其总体能力,称为对齐税。现有方法通过平衡双重目标来缓解这一问题,这些目标严重依赖于大量通用数据或辅助奖励模型。在本文中,我们认为,由于安全特征在输出分布中本质上是稀疏的,因此对齐需要局部修改而不是全局权衡。为此,我们提出了 SafeSteer,它执行仅限于安全词元的策略蒸馏。首先,我们通过激活指导构建一个安全教师。基于这位老师,我们开发了安全词元选择算法。因此,SafeSteer 在训练期间限制对这些词元的反向 KL 惩罚,以保留一般功能。不同模型的实验结果表明,与现有方法相比,我们的 SafeSteer 在安全性和通用能力之间实现了卓越的权衡,在七个安全基准上实现了强大的安全性能,而在五个通用能力基准上仅出现了最小的退化。值得注意的是,SafeSteer 仅需要 100 个有害样本,无需使用任何通用数据,不到之前基线使用的 1%,大大降低了对齐成本。更多详细信息请参见我们的项目页面:https://anjingkun.github.io/SafeSteer。
