论文

偏好调整的马尔可夫链方法

A Markov Chain Approach to Preference Alignment

模型训练偏好优化

摘要

我们从人类反馈(MCHF)中提出了马尔可夫链,这是一种根据成对的人类偏好调整生成模型的基本方法。与人类反馈强化学习 (RLHF) 和人类反馈纳什学习 (NLHF) 不同,前者减少了与标量奖励的比较,后者通过 KL 正则化极小极大优化保留成对效用,MCHF 直接使用成对偏好来定义模型输出的转换机制。给定一个成对效用$U(x,y)$,它量化了人类对$y$相对于$x$的偏好,以及参考概率分布$μ_{\mathsf{ref}}$,我们定义一个马尔可夫核$\mathsf{P}(x, dy)\propto \exp(U(x,y))μ_{\mathsf{ref}}(dy)$,并从马尔可夫链开始$μ_{\mathsf{ref}}$ 作为迭代对齐过程。我们证明 MCHF 在几何上快速收敛到平稳分布,收敛速度由半范数 $\|U\|_\oplus=\inf_{g,f\in L^\infty(μ_{\mathsf{ref}})}\|U-g\oplus f\|_\infty$ 控制,它量化了成对效用的非传递结构。我们进一步表明,NLHF 的镜像下降算法满足类似的结构自适应收敛保证。最后,通过扰动分析,我们证明当 $\|U\|_\oplus$ 很小时,MCHF 和 NLHF 围绕 RLHF 解决方案达成一阶一致,这产生了基于奖励、博弈论和马尔可夫对齐方法的统一视图。特别是,对于收敛到 MCHF/NLHF 平衡的两种自然算法,我们表明 MCHF 和 NLHF 的第一步基于列和奖励 $\hat{f}(y)=\int μ_{\mathsf{ref}}(dx) U(x, y)$ 恢复 RLHF 解,并且从第二次迭代开始,两种算法都包含残差 $U-(-\hat f)\oplus 的相同线性函数\hat f$,它捕获成对效用 $U$ 的非传递结构。