论文
具有用于数学推理的可执行验证器的函数结构强化学习
Function-Structured Reinforcement Learning with Executable Verifiers for Mathematical Reasoning
摘要
算法数学推理需要可靠的分解、计算和聚合。最终答案奖励对中间错误提供有限的指导,而成功执行并不能保证数学正确性。这项工作提出了函数结构图强化学习(FSG-RL),将子问题图和 Python 实现与多验证者反馈连接起来。该策略首先学习通过监督微调(SFT)从函数图生成代码。然后,组相对策略优化 (GRPO) 使用答案门控奖励和跨级别信用分配来优化策略。该框架还支持教师监督和结构化记忆。由小学数学 8K (GSM8K)、MathQA、MATH 和 Omni-MATH 策划的基准将公共函数图与私有验证规范配对。在统一的评估协议下,与 SFT 相比,GRPO 将最终答案的准确性从 43.25% 提高到 67.50%,并将完整解决方案的成功率从 32.25% 提高到 52.25%。在教师监督下持续强化学习(RL)会产生额外的收益。收益不仅限于生成格式正确的代码,还支持验证者引导的数学推理强化学习。代码可在 https://github.com/ZihanLiummyycc/FSG-RL. 获取