论文
重新审视奖励优化的缩放法则
Revisiting scaling laws for reward optimization
摘要
针对人工智能对齐中的奖励模型进行优化的缩放法则已经确定了性能如何取决于优化工作——通过相对于参考策略的 KL 散度预算来衡量。超出一定的预算,可能会出现过度优化(或奖励作弊):因为我们针对代理奖励模型(与真实奖励不同)进行优化,所以性能可能会趋于稳定或下降。当然,代理奖励的准确性取决于训练它时使用了多少偏好数据(通常以成对比较的形式)。然而,现有的研究并没有清楚地确定性能如何与训练数据量和分歧预算共同扩展。我们的主要贡献是在这种背景下提供一个经验上准确且有理论依据的缩放定律。性能大致按 $θ(\sqrt{\min\{\log(M),K\}})$ 缩放,其中 $M$ 是训练数据中的比较次数,$K$ 是策略的发散预算。我们开发了一个信息论模型来建立这个上限,并证明它可以通过建设性的过程严格实现。据此,我们使用现实世界的注释设置进行了广泛的实证评估,其中大型 70B 黄金奖励模型生成反馈数据,并从能力较差的模型(0.6B 到 4B)训练代理奖励模型。我们的缩放法则提供了极佳的拟合度(R2 从 97\% 到 99\%),优于替代规范,并且在模型大小、噪声和优化程序(best-of-$N$ 或策略倾斜)方面保持稳健。我们的证据表明,奖励优化类似于一个令人惊讶的简单选择任务:使用噪声偏好反馈从 IID 高斯随机变量序列中进行选择。