论文
logits 空间中的护栏:LLM 对齐的安全词元正则化
Guardrails in Logit Space: Safety Token Regularization for LLM Alignment
摘要
新域上的 微调 良好对齐的 大语言模型 (LLM) 通常会降低其安全对齐,即使使用良性数据集也是如此。现有的安全调整技术主要集中于预训练,使得微调模型容易受到行为变化的影响。在这项工作中,我们引入了安全词元正则化(STR),这是一种轻量级方法,旨在在 微调 期间保留安全属性。我们的方法从对齐良好的模型的拒绝模板中识别显着标记,并在训练期间约束其关联的 logits,从而防止关键安全行为的丢失。与强化学习或偏好优化方法不同,STR 需要最少的额外计算,并与 LoRA 等参数高效的 微调 技术无缝集成。全面的实验表明,我们的方法实现了与最先进的方法相当的安全性能,同时保留了特定于任务的实用性并需要最小的实现开销。此外,我们表明安全词元正则化可以增强训练稳定性和整体性能,而不仅仅是安全考虑。这项工作为微调 LLM 中的持续安全调整提供了实用且易于部署的策略。