论文
通过平衡直接偏好优化改进安全对齐
Improving Safety Alignment via Balanced Direct Preference Optimization
摘要
随着大语言模型(LLM)的快速发展与广泛应用,其潜在安全风险受到广泛关注。基于人类反馈的强化学习(RLHF)已被用于增强 LLM 的安全性能。作为 RLHF 简单而有效的替代方案,直接偏好优化(DPO)被广泛用于安全对齐。然而,安全对齐仍受严重过拟合困扰,这限制了其实际性能。本文从模型对训练数据的理解这一视角重新审视过拟合现象。我们发现偏好对中的两个回复之间存在偏好理解不平衡(Imbalanced Preference Comprehension)现象,这损害了模型的安全性能。为解决这一问题,我们提出平衡直接偏好优化(B-DPO),基于互信息在偏好与非偏好回复之间自适应地调节优化强度。一系列实验结果表明,与最先进方法相比,B-DPO 能在保持 LLM 于各类主流基准上具有竞争力的通用能力的同时增强安全能力。警告:本文包含有害文本示例,建议读者自行斟酌阅读。
