论文
BSO:安全对齐就是密度比匹配
BSO: Safety Alignment Is Density Ratio Matching
摘要
调整语言模型的有用性和安全性通常需要复杂的管道——单独的奖励和成本模型、在线强化学习和原始对偶更新。最近的直接偏好优化方法简化了训练,但通过临时修改(例如多阶段程序或启发式边缘项)纳入了安全性,缺乏原则推导。我们表明,最优安全策略的似然比允许封闭式分解,将安全对齐简化为密度比匹配问题。最小化数据和模型比率之间的 Bregman 散度会产生 Bregman 安全优化 (BSO),这是一系列单阶段损失函数,每个函数均由凸生成器引发,可证明恢复最优安全策略。 BSO 既通用又简单:它不需要辅助模型,仅引入一个超出标准偏好优化的超参数,并将现有的安全感知方法恢复为特殊情况。跨安全调整基准的实验表明,BSO 不断改善安全性与有用性的权衡。