论文

SafeSteer:面向高效安全对齐的局部同策略蒸馏

SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment

摘要

将大型语言模型 (LLM) 与人类价值观保持一致通常会降低其总体能力,称为对齐税。现有方法通过平衡双重目标来缓解这一问题,这些目标严重依赖于大量通用数据或辅助奖励模型。在本文中,我们认为,由于安全特征在输出分布中本质上是稀疏的,因此对齐需要局部修改而不是全局权衡。为此,我们提出了 SafeSteer,它执行仅限于安全词元的策略蒸馏。首先,我们通过激活指导构建一个安全教师。基于这位老师,我们开发了安全词元选择算法。因此,SafeSteer 在训练期间限制对这些词元的反向 KL 惩罚,以保留一般功能。不同模型的实验结果表明,与现有方法相比,我们的 SafeSteer 在安全性和通用能力之间实现了卓越的权衡,在七个安全基准上实现了强大的安全性能,而在五个通用能力基准上仅出现了最小的退化。值得注意的是,SafeSteer 仅需要 100 个有害样本,无需使用任何通用数据,不到之前基线使用的 1%,大大降低了对齐成本。更多详细信息请参见我们的项目页面:https://anjingkun.github.io/SafeSteer。

SafeSteer:面向高效安全对齐的局部在策略蒸馏:论文配图
图 2:SafeSteer 管道:(1) 通过激活引导构建安全教师 πt\pi_{t},(2) 通过 πt\pi_{t} 响应的对比对数概率选择安全令牌 𝒮\mathcal{S},以及 (3) 使用 𝒮\mathcal{S} 上的令牌级本地化反向 KL 将 πt\pi_{t} 蒸馏为 πs\pi_{s}。