论文

MoPLEx:估计多目标对齐的 Plackett-Luce 混合模型

MoPLEx: Estimating Plackett-Luce Mixture Models for Multi-Objective Alignment

模型训练奖励建模与过程监督

摘要

我们研究从注释者的多向排名响应中学习 $k$ Plackett-Luce 模型的混合,这些模型可能代表异构的潜在偏好。这个问题在人工智能对齐和偏好优化中有很多应用。先前的工作通过成对比较研究了 Bradley-Terry 模型的混合。然而,当 $k$ 超过 $m/2$ 时,估计多路排名模型的混合在理论上可能会变得无法识别,其中 $m$ 是排名长度。我们设计了一种有效的算法来解决这个问题,首先将排名增加到更大的尺寸(例如,从基本模型生成比较),然后进行基于梯度的估计以减少推理成本(在输入嵌入空间中)。考虑到这个过程,我们然后通过期望最大化式迭代(简称 MoPLEx)拟合 Plackett-Luce (PL) 模型的混合。我们进行了大量的实验来验证该算法。首先,我们发现基于梯度的近似在具有多达 340 亿个参数的模型上估计真实概率的误差小于 5%。其次,在 UltraFeedback 和 PERSONA 数据集上,与使用单个 PL 模型或 Bradley-Terry 模型混合的基线相比,MoPLEx 将聚类和排名准确度平均提高了 43.7% 和 15.2%。这些结果证明了 MoPLEx 通过梯度测量对齐来处理遵循异构偏好的多向排名的有效性。