论文

多个潜在排序​​可以更好地预测语言模型偏好

Multiple latent orderings better predict language model preferences

模型评测模型行为与机制分析

摘要

语言模型经常用于需要做出价值判断和选择的环境中。这些观察到的选择通常表现出不及物性:模型可能更喜欢项目 $A$ 而不是 $B$,以及 $B$ 而不是 $C$,同时也更喜欢 $C$ 而不是 $A$。现有的 LLM 偏好建模工作将这种不一致视为围绕单个潜在排序​​的采样噪声。相反,我们建议不及物性反映了多个潜在的、内部一致的顺序的聚合。我们首先证明观察到的不一致不能用任何单调链接函数下的单一排序来解释。然后,我们引入了一种噪声增强混合 Bradley-Terry (MBT) 模型,该模型通过重复的成对比较来推断潜在偏好成分。在七个模型和四个任务中,顺序的混合通常比单一实用程序模型更好地解释结构不一致。我们发现总体偏好常常隐藏潜在的偏好异质性。关于道德机器困境的案例研究表明,在聚合顺序上不一致的模型仍然可以共享潜在组件。总之,这些结果表明大语言模型反映了多元化的偏好。将LLM偏好视为单一函数的对齐和评估管道,因此,不同用户可能以不同方式认可的连贯顺序的风险平均。