论文
BoT-GRPO:以Token奖励聚合提高过程监督RL效率
BoT-GRPO: Efficient Process-Reward RL for Reasoning via Bag-of-Token Aggregation
摘要
强化学习现在是大型语言模型中引发推理的核心,而在流行的算法组相对策略优化(GRPO)中,Rollout中的每个Token都具有相同的优势。我们询问如何提高流程监督的效率:加速收敛并提高最终质量,而无需付出价值网络的成本。我们提出了Token袋组相对策略优化(BoT-GRPO),它通过长度不变的“Token袋”聚合将 GRPO 扩展到Token级奖励模型:它收集整个部署过程中的所有Token级奖励,通过其源序列长度的倒数对每个Token进行加权,并计算每个Token相对于加权组统计数据的优势。 BoT-GRPO 不受批评,并且当Token级别奖励可用时,无论何时使用 GRPO,它都是一个直接替代品。在 React 前端代码生成方面,BoT-GRPO 的编译率达到 $80\%$,比 GRPO 快 $1.9\times$,并且比现代 GRPO 变体(GSPO、DAPO、PURE)收敛得更快,同时达到更高的最终编译和 VLM 判断的获胜率。在第二个任务中,AIME 数学 推理,BoT-GRPO 的绝对 Pass@$k$ 收益比 GRPO 只需一半的步骤即可达到 $8.1\%$。对于这两项任务,我们比较了算法在推理与非推理基本模型系列(Qwen2.5-3B、SmolLM3-3B、Phi-4-mini-reasoning)上的性能。我们的实验还为奖励模型本身提供了一个实用的方法:奖励稳定性比丰富性更重要:干净、有界、稳定的细粒度信号持续加速学习,而嘈杂的替代方案则停滞不前。
