论文
偏好优化的标准化奖励
Normalized Rewards for Preference Optimization
摘要
DPO 等直接对齐算法 (DAA) 已成为根据人类偏好进行后训练和对齐 LLM 的常用方法。然而,据观察,DAA 过度优化其隐式奖励模型并降低了首选响应的可能性。这会导致分配给偏好数据集中的响应的总可能性降低,从而可能导致不良行为。为了抵消 DAA 的这种不良副作用,我们检查了使用添加正则化项的目标来维持所选响应和拒绝响应的总长度归一化概率的效果。为了更好地理解过度优化,我们研究了在有和没有正则化的情况下响应似然变化如何分布在标记上。我们发现很大一部分可能性变化是由于一小部分异常标记造成的,这解释了 DAA 如何在降低所选响应的可能性的情况下提高生成质量。我们将所提出的正则化应用于基于参考(DPO)和无参考(SimPO)方法,并发现(1)改进了生成质量和一般基准能力之间的权衡,以及(2)改进了跨数据集的奖励建模。例如,在 Llama-3.1-8B-Instruct 上,我们发现 AlpacaEval2 分数相对增加了 >20%,在一般基准测试中相对性能提升了 >9%。此外,我们发现添加的正则化项通过利用低似然标记,有效地减轻了整体首选响应中的位移量,特别是对于异常标记。