论文
GDEPO:面向样本受限强化学习、提升训练数据利用率的组双重动态与等权优势策略优化
GDEPO: Group Dual-dynamic and Equal-right-advantage Policy Optimization with Enhanced Training Data Utilization for Sample-Constrained Reinforcement Learning
摘要
自动定理证明(ATP)是人工智能(AI)中的一项基础性挑战,需要在Lean等形式语言中构造机器可验证的证明,以评估AI的推理能力。强化学习(RL),尤其是高性能的组相对策略优化(GRPO)算法,已成为该任务的主流方法。然而,在ATP场景中,GRPO面临两个关键问题:当使用复合奖励时,其相对优势估计可能与形式验证器的二值反馈相冲突;同时,其静态采样策略可能在未找到有效证明时丢弃整批数据,导致对模型更新零贡献并造成显著的数据浪费。为解决这些局限,我们提出组双重动态与等权优势策略优化(GDEPO),该方法包含三个核心机制:1)动态额外采样,对无效批次重采样,直到发现有效证明;2)等权优势,将优势函数的符号(基于正确性)与其幅值(由辅助奖励调制)解耦,以确保稳定且正确的策略更新;3)动态额外迭代,对最初失败但最终成功的样本施加额外的梯度步,以加速在具有挑战性案例上的学习。在三个不同难度数据集(MinF2F-test、MathOlympiadBench、PutnamBench)上进行的实验证实了GDEPO的有效性,消融研究验证了其各组件协同的必要性。所提方法提升了数据利用率与优化效率,为ATP提供了一种新的训练范式。
