论文

RLVR 中的奖励粒度:比较小语言模型中数学推理的过程和结果奖励结构

Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Models

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)已成为改进语言模型中数学推理的有前途的范例。然而,大多数 RLVR 工作仅奖励最终答案(基于结果的奖励),而没有充分探索步骤级过程监督(过程奖励)的影响,特别是对于在稀疏反馈下缺乏自我纠正能力的小型模型。我们系统地比较了应用于 GSM8K 上通过组相对策略优化 (GRPO) 微调的 Qwen2.5-0.5B 的五种奖励条件:无 RL 基线、仅过程、仅结果和三个混合权重($λ\in \{0.9, 0.5, 0.1\}$ 过程权重)。仅过程监督的测试准确度为 63.73%,而仅结果监督的测试准确度为 53.75%,相差近 10 个百分点,同时产生具有更高步骤有效性和与 真值 链长度偏差更低的推理轨迹。混合奖励通常与过程权重正相关,有一个值得注意的异常:低过程/高结果配置($λ=0.1$)表现不佳于纯结果监督,这表明优化信号存在冲突。使用 GPT-4o 作为判断的错误分析揭示了不同的故障模式分布:过程模型生成结构不一致但具有算术依据的推理轨迹,而结果模型生成简洁但易于推导错误的链。我们的结果表明,奖励粒度是 RLVR 的一阶设计决策,过程级监督大大提高了小语言模型的准确性和跟踪保真度。