论文
自回归直接偏好优化
Autoregressive Direct Preference Optimization
摘要
直接偏好优化(DPO)已成为使大语言模型(LLM)与人类偏好对齐的一种有前景的方法。然而,对响应级Bradley-Terry(BT)模型的广泛依赖可能限制其全部潜力,因为参考模型与可学习模型仅在推导出目标函数之后才被假设为自回归的。受此局限启发,我们重新审视DPO的理论基础,提出一种新形式,在应用BT模型之前显式引入自回归假设。通过重新表述并扩展DPO,我们推导出一个新变体,称为自回归DPO(ADPO),它把自回归建模显式整合进偏好优化框架。在不违背理论基础的情况下,所得损失具有优雅的形式:它把DPO目标中的求和运算移到log-sigmoid函数之外。此外,通过对ADPO的理论分析,我们表明在设计基于DPO的算法时存在两种需考虑的长度度量:token长度μ与反馈长度μ′。据我们所知,我们是首个显式区分这两种度量并分析其对LLM偏好优化影响的工作。
