论文
ReflectRM:在统一评判框架内通过自我反思增强生成式奖励模型
ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework
摘要
奖励模型 (RM) 是人类反馈强化学习 (RLHF) 管道中的关键组件,直接决定大语言模型 (LLM) 的对齐质量。最近,生成奖励模型(GRM)已成为一种优越的范式,与传统的标量 RM 相比,它提供了更高的可解释性和更强的泛化性。然而,现有的 GRM 方法主要侧重于结果层面的监督,忽视了分析过程的质量,这限制了它们的潜力。为了解决这个问题,我们提出了 ReflectRM,一种新颖的 GRM,它利用自我反思来评估分析质量并增强偏好建模。 ReflectRM 在统一的生成框架下进行训练,用于响应偏好和分析偏好的联合建模。在推理过程中,我们利用其自我反思能力来识别最可靠的分析,从中得出最终的偏好预测。四个基准测试的实验表明,ReflectRM 持续提高性能,在 Qwen3-4B 上实现了 +3.7 的平均准确度增益。进一步的实验证实,响应偏好和分析偏好是相辅相成的。值得注意的是,ReflectRM 大大减轻了位置偏差,与领先的 GRM 相比,提高了 10.2 倍,并确立了自己作为更稳定评估器的地位。
