论文

面向大语言模型数学推理的 GRPO 与反思奖励

GRPO and Reflection Reward for Mathematical Reasoning in Large Language Models

模型训练强化学习RLVR

摘要

大语言模型(LLM)推理能力的增强已受到极大关注,监督微调(SFT)与强化学习成为主导范式。尽管近期研究认识到反思在推理过程中的重要性,现有方法却很少涉及在训练中主动鼓励反思。本研究聚焦数学推理,提出一个将组相对策略优化(GRPO)与反思奖励机制相结合的四阶段框架,以强化 LLM 的自反思能力。此外,该方法还纳入了已有的准确率与格式奖励。实验结果表明,经反思鼓励训练的 GRPO 取得最先进性能,消融研究证实了反思奖励的关键作用。对比评估表明,尽管计算需求更高,全参数 SFT 仍优于低秩适配(LoRA)。基于这些累积发现,本研究证实了 GRPO 在后训练优化中的方法论意义,并展望其通过认知奖励与动态环境交互的协同结合,成为未来基于 LLM 的智能体的关键赋能者的潜力。