论文

超越长度扩展:为生成式奖励模型协同广度与深度

Beyond Length Scaling: Synergizing Breadth and Depth for Generative Reward Models

模型训练奖励建模与过程监督

摘要

生成式奖励模型(GRM)的最新进展表明,扩展思维链(CoT)推理的长度可显著提升评估可靠性。然而,当前工作主要依赖非结构化的长度扩展,忽视了不同推理机制的差异效用:广度 CoT(B-CoT,即多维原则覆盖)与深度 CoT(D-CoT,即实质判断的可靠性)。为此,我们提出 Mix-GRM,通过模块化合成流水线把原始理由重构为结构化的 B-CoT 与 D-CoT,随后用监督微调(SFT)和可验证奖励强化学习(RLVR)内化并优化这些机制。全面实验表明 Mix-GRM 在五个基准上树立新的最先进水平,平均超越领先开源奖励模型 8.2%。我们的结果揭示推理上的明确分工:B-CoT 有利于主观偏好任务,而 D-CoT 擅长客观正确性任务。因此,推理机制与任务错配会直接降低性能。此外,我们证明 RLVR 起到开关放大器的作用,诱发一种涌现的两极分化:模型自发地把推理风格分配得与任务需求匹配。合成数据与模型已在 Hugging Face 发布,代码已在 Github 发布。

超越长度扩展:为生成式奖励模型协同广度与深度
图1:Mix-GRM的流水线。(i) 标准化:我们将原始理由(rationale)提取为模块化的原则–判断–裁定(Principle–Judgment–Verdict)单元。(II) 机制合成:我们将这些模块重构为面向偏好的B-CoT或面向正确性的D-CoT。(III) 训练与推理:经过SFT与RLVR训练后,模型实现机制自适应的对齐,自动部署最优机制进行推理,并为离线RL(Offline RL)与测试时扩展(test-time scaling)等下游任务提供可靠信号。