论文

ARG:在推理强化学习中平衡参考前缀与自由生成

Balancing Reference Guidance and Free Generation in Trajectory Rollouts for Reasoning RL

模型训练强化学习合成数据

摘要

经过验证的参考解决方案为训练推理模型提供了正确的轨迹。或者,参考的前缀可以指导模型生成自己的轨迹。我们应该提供多少参考指导?我们通过前缀延续来研究这个问题,其中模型从参考前缀继续,如果通过验证则保持结果轨迹,否则回落到参考。由于这两个过程都会产生正确的轨迹,因此我们将它们的分布与理想分布进行比较,理想分布是模型自身的分布以成功验证为条件。对于一个延续,我们导出封闭形式的 KL 散度,该散度在有界项之前随着生成不同正确轨迹的概率和参考意外(给定前缀的参考后缀的负对数概率)的乘积而减小。由于较长的前缀往往会提高前者,但会降低后者,因此仅延续成功并不能确定首选的指导量。从这个分析中,我们学到了一个前缀 选择者在连续结果中共享培训问题,无需估计成功概率或额外生成。由此产生的自适应参考指导(ARG)在固定的发电预算内构建正确的轨迹,并且我们将其应用于组相对策略优化(GRPO)中的所有故障组。在 Qwen3-4B 和 Qwen3-8B 上跨五个数学推理基准的实验表明,ARG 在具有竞争性平均采样精度的评估方法中实现了最高的聚合 pass@12。