论文

ReflectRM:在统一评判框架内通过自我反思增强生成式奖励模型

ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework

模型训练奖励建模与过程监督

摘要

奖励模型 (RM) 是人类反馈强化学习 (RLHF) 管道中的关键组件,直接决定大语言模型 (LLM) 的对齐质量。最近,生成奖励模型(GRM)已成为一种优越的范式,与传统的标量 RM 相比,它提供了更高的可解释性和更强的泛化性。然而,现有的 GRM 方法主要侧重于结果层面的监督,忽视了分析过程的质量,这限制了它们的潜力。为了解决这个问题,我们提出了 ReflectRM,一种新颖的 GRM,它利用自我反思来评估分析质量并增强偏好建模。 ReflectRM 在统一的生成框架下进行训练,用于响应偏好和分析偏好的联合建模。在推理过程中,我们利用其自我反思能力来识别最可靠的分析,从中得出最终的偏好预测。四个基准测试的实验表明,ReflectRM 持续提高性能,在 Qwen3-4B 上实现了 +3.7 的平均准确度增益。进一步的实验证实,响应偏好和分析偏好是相辅相成的。值得注意的是,ReflectRM 大大减轻了位置偏差,与领先的 GRM 相比,提高了 10.2 倍,并确立了自己作为更稳定评估器的地位。

ReflectRM:在统一评判框架内通过自我反思增强生成式奖励模型
图 2:ReflectRM 方法概述。 (上)我们的统一判断框架,它将响应偏好和分析偏好建模为单个条件生成过程。 (下)两阶段推理策略,利用模型的自我反思能力来识别和聚合可靠的分析痕迹,从而产生更稳健和可靠的最终判断。