论文

RGPO:用自适应推导支架引导策略优化

Rationale-Guided Policy Optimization: Learning to Reason with Adaptive Rationale Scaffolding

模型训练强化学习RLVRAgentic RL

摘要

同策略强化学习已成为提高大语言模型推理能力的中心范式。然而,它的有效性通常受到奖励稀疏性的限制:当模型无法发现困难问题的正确轨迹时,优化过程收到的有用信号很少,并且可能会停滞。现有方法通过结合非策略演示、专家跟踪或模型生成的解决方案来缓解这个问题,但它们通常需要辅助数据来匹配强化学习任务的格式,通常依赖于更强模型的拒绝采样来获得合适的训练轨迹。我们引入了基本原理引导的策略优化 (RGPO),这是一个框架,可以根据模型当前的能力自适应地利用真实基本原理信息,同时保留其探索的自由度。 RGPO 没有将参考解决方案视为固定的模仿目标,而是将它们用作临时支架:基本原理帮助模型生成改进的响应,之后只有更高奖励的模型生成的解决方案被转移回原始的无引导设置。这种设计允许训练利用可用的地面实况信息,而不需要策略外的数据遵循与 RL 任务相同的格式。在纯语言和视觉语言推理设置中,RGPO 持续提高了 RLVR 基线的性能,消融 研究表明,自适应基本原理指导是这些收益的关键贡献者。这些结果表明,RGPO 提供了一种实用且通用的方法,可以减少奖励稀疏性、稳定强化学习并提高纯文本和多模态模型的推理性能。

RGPO:用自适应推导支架引导策略优化:论文原图
图 1:所提出方法的概述:受人类处理问题方式的启发,该模型首先尝试在不获取提示的情况下解决每个问题。当它成功时,正确的反应就会被直接强化。当它失败时,会引入逐渐更强的理由作为临时支架来引导模型找到正确的解决方案。