论文

降低 LLM 中的安全税 与 同策略 自 蒸馏 安全对齐

Reducing the Safety Tax in LLM Safety Alignment with On-Policy Self-Distillation

模型训练监督微调与指令调优

摘要

安全对齐通常会以推理能力为代价来提高对有害查询的鲁棒性,这种权衡称为安全税。一个常见的原因是分布不匹配:受监督的 微调 根据人类、外部模型或固定的自生成轨迹生成的安全演示来训练目标模型,而不是根据从其自身策略采样的轨迹来训练目标模型。我们将 离策略 训练不匹配确定为该税收的第二个来源,并研究 同策略 自 蒸馏 进行安全调整,我们称之为 OPSA。该模型会生成自己的首次展示,并从其自身的冻结教师副本(以特权安全环境为条件)接收密集的每个词元 KL 监督。因为这位老师必须比采样的学生轨迹更安全,所以我们引入 \emph{老师翻转率}:衡量特权上下文将不安全响应转换为安全响应的频率的标准。我们使用这个信号来搜索激活潜在安全推理的上下文,而不仅仅是引发看似安全的演示。在两个推理模型系列和五个模型尺度中,OPSA 在匹配数据和全参数 微调 下实现了比 离策略 自 蒸馏 和外部教师 蒸馏 更强的安全推理权衡,在较小模型上收益最大(R1-Distill-1.5B 上 +8.85 点和 +5.49 点)在 Qwen3-0.6B 上)。在训练集大小和自适应越狱评估方面,这种收益仍然存在。 词元级 分析进一步表明,OPSA 将更新集中在早期合规决策词元附近,提供了一种在保留一般推理的同时提高安全性的机制。