论文
学习纠正:多次尝试思想链的校准强化学习
Learning to Correct: Calibrated Reinforcement Learning for Multi-Attempt Chain-of-Thought
摘要
最先进的推理模型利用长思维链 (CoT) 通过更多的测试时间计算来解决日益复杂的问题。在这项工作中,我们探索了一个长 CoT 设置,其中模型在解决问题时进行了 K 次连续尝试,其中在模型收到硬验证者反馈后,每次尝试都可以建立在早期尝试的基础上。这激发了强化学习方法可以通过仔细权衡个人尝试来利用每次尝试的奖励。我们研究了优化 Verification@K 奖励(模型在第 K 次尝试时成功),并表明天真地通过通过/失败来衡量尝试会导致有偏差的梯度。我们通过设计一种权重策略来引入校准尝试级别(CAL)GRPO,以获得无偏梯度,同时保持较小的方差。我们的理论揭示了结合每次尝试奖励如何影响训练和最终的 Verification@K 性能。实验、基线以及对合成数据和真实数据的消融证实了我们的理论以及 CAL-GRPO 相对于普通 GRPO 以及朴素加权的优势。