论文

通过平衡直接偏好优化改进安全对齐

Improving Safety Alignment via Balanced Direct Preference Optimization

模型训练偏好优化

摘要

随着大语言模型(LLM)的快速发展与广泛应用,其潜在安全风险受到广泛关注。基于人类反馈的强化学习(RLHF)已被用于增强 LLM 的安全性能。作为 RLHF 简单而有效的替代方案,直接偏好优化(DPO)被广泛用于安全对齐。然而,安全对齐仍受严重过拟合困扰,这限制了其实际性能。本文从模型对训练数据的理解这一视角重新审视过拟合现象。我们发现偏好对中的两个回复之间存在偏好理解不平衡(Imbalanced Preference Comprehension)现象,这损害了模型的安全性能。为解决这一问题,我们提出平衡直接偏好优化(B-DPO),基于互信息在偏好与非偏好回复之间自适应地调节优化强度。一系列实验结果表明,与最先进方法相比,B-DPO 能在保持 LLM 于各类主流基准上具有竞争力的通用能力的同时增强安全能力。警告:本文包含有害文本示例,建议读者自行斟酌阅读。

通过平衡直接偏好优化改进安全对齐:论文配图
图 1:B-DPO 示意图。我们发现安全偏好对中存在不平衡的偏好理解,这会对安全调整产生负面影响。我们的B-DPO根据理解程度针对不同的响应调整优化强度,最终提高LLM的安全性能。