论文

从 Best-of-$N$ 偏好数据中进行奖励学习:目标、权衡和设计原则

Reward Learning from Best-of-$N$ Preference Data: Targets, Tradeoffs, and Design Principles

模型训练奖励建模与过程监督

摘要

Best-of-$N$ 抽样广泛用于构建成对偏好数据:$N$ 候选者是从基本分布中抽取的,最好的与被拒绝的响应配对。尽管它被广泛使用,但 Bradley-Terry (BT) 奖励学习从这些数据中提取什么,以及如何选择 $N$ 和基本分布,仍然不清楚。我们最近通过其诱导条件分布对 Best-of-$N$ 进行了专门的偏好数据分析。对于独立参考变体,我们将封闭形式的奖励目标导出为 $N$ 和基本分布的显式函数,并表明它们保留了潜在的奖励排名。对于实际的最佳与随机和最佳与最差变体,选择和拒绝的响应通过相同的候选集耦合,因此精确的 BT 表示通常会失败;然而,随着 $N$ 的增长,有界类最小化器会接近参考目标。尽管众所周知,边际和连通性控制着成对偏好学习中的样本效率,但 Best-of-$N$ 通过 $N$ 以相反的方向将它们耦合起来:较大的 $N$ 扩大了成对边际,但降低了连通性。这种权衡产生了两个设计原则:当偏好标签是瓶颈时使用较大的$N$,当生成是瓶颈时使用较小的$N$;并塑造基础分布,以在测试时比较最重要的响应之间放置质量。对合成和真实偏好数据的实验支持对样本大小和基础分布形状的预测依赖性。