论文
iGRPO:自反馈驱动的LLM推理
iGRPO: Self-Feedback-Driven LLM Reasoning
摘要
大语言模型(LLM)在求解复杂数学问题上已展现出前景,但仍难以产出准确且一致的解答。强化学习(RL)是一种通过任务特定奖励使这些模型对齐、提升整体质量与可靠性的框架。组相对策略优化(GRPO)是近端策略优化(PPO)的一种高效、免价值函数的替代方案,利用组相对奖励归一化。我们提出迭代组相对策略优化(iGRPO),GRPO的两阶段扩展,通过模型自生成的草稿引入动态自条件。在阶段1,iGRPO采样多个探索性草稿,并使用与优化相同的标量奖励信号选出奖励最高的草稿。在阶段2,它把该最佳草稿附加到原始提示之后,对以草稿为条件的精炼施加GRPO式更新,训练策略超越其此前最强的尝试。在匹配的rollout预算下,iGRPO在多个基座模型(如Nemotron-H-8B-Base-8K与DeepSeek-R1蒸馏版)上一致优于GRPO,在多样化推理基准上验证了其有效性。此外,把iGRPO应用于在AceReason-Math上训练的OpenReasoning-Nemotron-7B,在AIME24与AIME25上分别取得85.62%与79.64%的新最优结果。消融实验进一步表明,该精炼包装可泛化到GRPO变体之外,能从生成式裁判中获益,并通过延迟熵坍缩改变学习动态。这些结果凸显了迭代式、基于自反馈的RL在推进可验证数学推理上的潜力。
