论文
奖励模型是秘密的价值函数:时间相干奖励模型
Reward Models Are Secretly Value Functions: Temporally Coherent Reward Modeling
摘要
RLHF 中的奖励模型经过训练,只对响应的最终标记进行评分 - 这种选择会丢弃来自每个中间位置的丰富信号,并生成 词元级 输出为噪声的模型。我们认为这是一个错失的机会:训练有素的奖励模型在任何词元上的输出都应该代表迄今为止给定响应的最终奖励的条件期望。我们引入了时间相干奖励模型(TCRM),它通过标准 Bradley-Terry 损失之上的两个正则化项来引入此属性,并且最小化器可证明等于条件期望。正则化器对应于蒙特卡罗和 TD 价值学习目标,建立与 RL 价值函数的直接联系。 TCRM 需要对架构、数据或推理进行零更改,但从一个原则中解锁了三种功能:可解释的 词元级 奖励轨迹(中间词元成对准确性从 50% 提高到 88.9%,最终词元准确性得以保留);仅根据结果数据训练的模型在 ProcessBench 上具有最先进的 PRM 性能(平均 F1 为 44.9%);以及 PPO 中的统一奖励/价值建模,在匹配 LLM 质量的情况下,峰值 GPU 内存减少了 27%,步骤时间减少了 19%。