论文

个性化 RewardBench:评估具有人性化个性化的奖励模型

Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization

模型评测基准与评测资源

摘要

多元化联盟已成为 大语言模型 (LLM) 开发的关键前沿,其中奖励模型 (RM) 充当捕捉不同人类价值观的中心机制。虽然一般响应质量的基准很普遍,但评估奖励模型如何更好地考虑个人用户偏好仍然是一个开放的挑战。为了弥补这一差距,我们引入了 Personalized RewardBench,这是一种新颖的基准,旨在严格评估奖励模型模拟个性化偏好的能力。我们根据严格遵守(或违反)用户特定规则构建选择和拒绝的响应对,确保偏好区别是针对个人独特定制的。特别是,人类评估证实,配对之间的主要区别因素完全是个人偏好,两种反应都保持较高的总体质量(例如,正确性、相关性和有用性)。大量测试表明,现有最先进的奖励模型在个性化方面表现不佳,最高准确率仅为 75.94%。至关重要的是,由于有效的奖励模型基准应该预测奖励模型在下游任务上的性能,因此我们进行的实验表明,与现有基准相比,我们的基准在 Best-of-N (BoN) 采样和近端策略优化 (PPO) 方面与下游性能表现出显着更高的相关性。这些发现使 Personalized RewardBench 成为评估奖励模型在下游应用程序中性能的强大且准确的代理。