论文

作为模型级序数可观察量的成对参考对齐

Pairwise Reference Alignment as a Model-Level Ordinal Observable

模型评测评测方法与指标

摘要

成对偏好数据广泛用于语言模型评估和对齐,通常用于模型排名、奖励建模或偏好优化。本文提出了一个更基本的测量问题:给定成对偏好的参考分布,当我们测试模型是否将首选响应排在拒绝响应之上时,估计模型级别的数量是多少?我们将成对参考对齐定义为由模型评分函数引起的序数可观察值。给定三元组 $(x,y^+,y^-)$ 上的参考对分布 $P_{\mathrm{pair}}$ 和标量模型得分 $S_M(x,y)$,我们将可观察的对齐定义为模型引发的排序与参考偏好排序一致的概率。我们进一步定义了一个类似中心订单参数的统计量,并讨论了基于保证金的扩展。所得到的量允许简单的有限样本估计量和独立采样假设下的浓度界限。本说明并未引入新的基准。它提供了成对参考对齐的概念和统计公式,阐明了参考对分布的作用,并将一般序数可观察值与评分选择(例如归一化对数概率或基于能量的分数)区分开来。我们还提供了关于 Qwen2.5 模型和 RewardBench 的初步实证研究,其中提出的统计数据随着模型大小和指令调整而增加,并且根据公式预测,在参考对子集之间变化。