论文

ConsensusBench:通过结果奖励致密化进行 LLM 推理的共识节点基准

ConsensusBench: Benchmark of Consensus Nodes for LLM Reasoning via Outcome Reward Densifying

模型训练奖励建模与过程监督

摘要

强化学习(RL)已成为大语言模型(LLM)推理增强的主要范式之一。特别是,组相对策略优化(GRPO)和相关算法在结果级奖励方面表现出了强劲的性能。然而,这些方法仅取决于最终答案,而没有关于哪些中间步骤导致成功或失败的反馈。随着任务复杂性和推理轨迹长度的增加,这种稀疏的最终答案奖励变得越来越不足。为了解决这一限制,我们引入了 ConsensusBench,这是一个新颖的数据集,旨在提供基于规则的流程级信号。我们假设正确的最终答案依赖于整个推理过程中的一小部分中间结论,这可以被视为可验证的子结果。我们通过从 N 个 rollout 中过滤正确的轨迹并对语义上等效的中间语句进行聚类来识别这些子结果。我们将这些聚集的语句称为共识节点。通过将从这些节点派生的基于规则的过程奖励集成到 GRPO 式算法中,我们开发了一种名为 ConsensusPR 的新强化学习信号。它直接减少了长推理轨迹上结果奖励的奖励稀疏性。为了促进系统化的流程级评估,我们在基准测试中引入了三个指标:最终答案准确性 (Acc)、节点覆盖率 (NCR) 和每个节点的词元 (TPN)。 AIME 2024、AIME 2025、GSM8K、MATH-500 和我们的 ConsensusBench 的实验表明,所提出的方法始终优于 GRPO 式方法,凸显了共识节点在指导推理方面的实用价值。