论文
安全调整课程学习
Curriculum Learning for Safety Alignment
摘要
直接偏好优化 (DPO) 广泛用于 大语言模型 中的安全对齐。然而,之前的工作表明它很脆弱,并且分布外(OOD)泛化能力很差。在本文中,我们研究了课程学习是否可以提高基于 DPO 的安全调整的稳健性。我们提出了 Staged-Competence,这是一个基于课程的框架,它按难度组织偏好数据,采用基于能力的抽样,并在训练期间逐步更新参考模型。对三个模型系列进行平均,阶段性能力将 OOD 有害响应率降低了 16%,越狱攻击成功率降低了 20%,同时保留了一般功能,过度拒绝率接近于零。我们进一步表明,阶段性能力 (1) 仅与 75% 的训练数据匹配基线安全性,并且 (2) 可以更好地区分安全和不安全响应。阶段性能力与策略优化损失无关,并且可以扩展到其他 DPO 变体和对齐域。我们的代码和数据可在 https://github.com/Sandeep5500/curriculum-learning-for-safety 获取。