论文
RREDCoT:推理模型的段级奖励重新分配
RREDCoT: Segment-Level Reward Redistribution for Reasoning Models
摘要
推理语言模型的最新进展是由强化学习 (RL) 微调 推动的。大多数情况下,这些依赖于组相对策略优化 (GRPO) 算法或其修改来引导模型生成思想链 (CoT) 跟踪。最终答案只能在 CoT 追踪完成后才能验证,并分配奖励,这使其成为延迟奖励问题。 GRPO 及其修改对应于标准 RL 中的蒙特卡罗方法,众所周知,该方法存在高方差。这个问题的一个可能的解决方案是通过贡献分配重新分配奖励,其中通过分配更高的奖励来强调对于达到理想解决方案很重要的 CoT 轨迹部分。虽然蒙特卡洛采样可用于提供中间状态值的无偏估计,但其计算开销使其不适合高粒度长上下文中的训练时间贡献分配。我们引入了 RREDCoT(思想链的奖励重新分配),它利用模型本身来近似最优奖励重新分配,而无需额外生成。我们研究了我们的方法与 MC 抽样和几种归因方法相比的优势。我们进一步分析了与重新分配的构造相关的几个方面,例如 CoT 轨迹的分段和状态值估计。