论文

RMGAP:跨不同偏好的奖励模型泛化基准测试

RMGAP: Benchmarking the Generalization of Reward Models across Diverse Preferences

模型评测基准与评测资源

摘要

来自人类反馈的强化学习已成为语言模型对齐的标准范例,其中奖励模型直接决定对齐有效性。在这项工作中,我们关注如何评估奖励模型的泛化性。我们所说的“普遍性”是指 RM 正确对响应进行排名以符合不同用户偏好的能力。然而,现有的奖励模型基准通常是围绕普遍偏好设计的,未能评估这种普遍性。为了解决这一关键差距,我们引入了 RMGAP,这是一个包含聊天、写作、推理和安全领域 1,097 个实例的基准测试。由于不同的用户对同一任务表现出不同的偏好,因此我们首先为每个收集的提示生成具有不同语言配置文件的四个不同的响应。然而,原始提示集缺乏传达不同偏好的特异性。因此,我们通过对比这些候选者并设计场景来构建量身定制的提示,其中一种响应成为唯一合适的选择。此外,我们观察到用户经常使用不同的措辞来表达相同的偏好,因此用两个释义变体来扩展每个提示。我们对 24 个最先进的 RM 的评估揭示了它们的巨大局限性:即使是最好的 RM 也只能达到 49.27% Best-of-N 准确度,这凸显了奖励模型泛化方面的巨大改进空间。相关数据和代码可参见https://github.com/nanzhi84/RMGAP。