论文

Cat-DPO:类别自适应安全调整

Cat-DPO: Category-Adaptive Safety Alignment

模型训练偏好优化

摘要

使 大语言模型 与人类偏好保持一致必须平衡两个相互竞争的目标:有益地响应合法请求并可靠地拒绝有害请求。大多数基于偏好的安全对齐方法将安全性压缩为统一应用于每个偏好对的单个标量。结果是一个平均看起来安全的模型,但在少数危害类别上仍然相对不安全。我们将安全对齐视为每个类别的约束优化问题,并派生出 Cat-DPO,这是一种直接偏好优化算法,针对每个危害类别具有单独的自适应安全裕度。当模型仍然对某个类别产生不安全的响应时,裕度会收紧,而一旦模型赶上,裕度就会放松,因此训练信号会跟踪每个类别的当前难度,而不是在一个全局速率下进行平均。跨越两个 LLM 主干和六个偏好学习基线,Cat-DPO 提高了总体有用性和无害性,并压缩了每个类别的安全差异和最好与最差的差距,提供了直接偏好安全对齐的按类别细化。