论文
奖励模型记住什么?
What do Reward Models Memorize?
摘要
本文通过测量两个人类偏好数据集的反事实记忆来研究经过区分训练的奖励模型(RM)记忆的内容。我们表明,RM 1)将记忆错误分配给简单的、高利润的偏好对,2)记住数据集特定的快捷方式(例如,模型身份、用户采样策略),以及 3)当面对看不见的偏好对时,过度概括人类偏好的简单启发式关联(例如,长度、合规性)。总的来说,我们的研究结果表明,根据人类偏好数据对 RM 进行歧视性训练会导致有偏见的 RM 尚无法判断上下文相关场景中的响应质量。