论文
表示感知优势估计:您的奖励模型提供的不仅仅是标量输出
Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output
摘要
当前的人类反馈强化学习 (RLHF) 方法主要依赖于经过训练的奖励模型 (RM) 的标量奖励。虽然有效,但标量奖励通常很嘈杂,并且无法捕获细粒度的偏好差异,而 RM 隐藏状态编码更丰富的语义和偏好信息。我们引入了表示感知优势估计,它利用 RM 隐藏状态并将其建模为辅助信号以实现更好的优势估计。具体来说,我们提出了基于图的优势估计(GraphAE),将每个采样组视为一个图,其中节点对应于响应,边捕获它们在 RM 隐藏空间中的相似性。然后通过图传播计算优势,使每个样本能够合并来自其邻居的上下文信息。 GraphAE 是轻量级的,可以无缝集成到现有的基于组的 RL 算法中。我们将 GraphAE 应用于 GRPO、GSPO 和 RLOO,并在不同的模型和基准上进行了大量的实验。实证结果显示,三个基准测试都有一致的改进,Arena-Hard-v0.1 的增益高达 + 6.3,AlpacaEval 2.0 的增益高达 + 8.27,MT-Bench 的增益高达 + 0.22。这些结果表明,利用 RM 表示可以提高样本效率和稳健的 RLHF。