论文

自回归直接偏好优化

Autoregressive Direct Preference Optimization

模型训练偏好优化

摘要

直接偏好优化(DPO)已成为使大语言模型(LLM)与人类偏好对齐的一种有前景的方法。然而,对响应级Bradley-Terry(BT)模型的广泛依赖可能限制其全部潜力,因为参考模型与可学习模型仅在推导出目标函数之后才被假设为自回归的。受此局限启发,我们重新审视DPO的理论基础,提出一种新形式,在应用BT模型之前显式引入自回归假设。通过重新表述并扩展DPO,我们推导出一个新变体,称为自回归DPO(ADPO),它把自回归建模显式整合进偏好优化框架。在不违背理论基础的情况下,所得损失具有优雅的形式:它把DPO目标中的求和运算移到log-sigmoid函数之外。此外,通过对ADPO的理论分析,我们表明在设计基于DPO的算法时存在两种需考虑的长度度量:token长度μ与反馈长度μ′。据我们所知,我们是首个显式区分这两种度量并分析其对LLM偏好优化影响的工作。

自回归直接偏好优化
图1:ADPO的静态族与自适应族。(a) token与反馈长度度量。每个子序列z_i由一个强组合ξ定义。(b–d) 窗口大小k固定的静态族。(e–g) 子序列数量固定的自适应族。(e) 对应于DPO。蓝色矩形标出在log-sigmoid函数内部进行求和的区域。