论文

相对密度比优化,实现稳定且统计一致的模型对齐

Relative Density Ratio Optimization for Stable and Statistically Consistent Model Alignment

模型训练偏好优化

摘要

将语言模型与人类偏好保持一致对于确保其安全性和可靠性至关重要。尽管大多数现有方法假设特定的人类偏好模型,例如 Bradley-Terry 模型,但这种假设可能无法准确捕获真实的人类偏好,因此,这些方法缺乏统计一致性,即随着样本数量的增加,语言模型收敛到真实的人类偏好的保证。相比之下,直接密度比优化(DDRO)无需假设任何人类偏好模型即可实现统计一致性。 DDRO 使用语言模型对首选数据分布和非首选数据分布之间的密度比进行建模,然后通过密度比估计对其进行优化。然而,这个密度比不稳定并且经常发散,导致DDRO的训练不稳定。在本文中,我们提出了一种既稳定又统计一致的新颖对齐方法。我们的方法基于首选数据分布与首选和非首选数据分布的混合之间的相对密度比。我们的方法是稳定的,因为该相对密度比有界于上方并且不会发散。此外,它在统计上是一致的,并且比 DDRO 产生更严格的收敛保证。我们通过 Qwen 2.5 和 Llama 3 实验证明了其有效性。