论文

学习超越您所采样的内容:RLVR 的非策略感知跨模型轨迹交换

Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR

模型训练强化学习RLVR

摘要

GRPO 等具有可验证奖励的强化学习 (RLVR) 方法依赖于成功的自我生成轨迹,但有限的部署预算可能会产生没有基于奖励的策略梯度信号的全失败组。虽然额外的rollout可以以更高的成本提高成功的机会,但一种模型的rollout所缺少的成功轨迹可能已经被另一种模型发现了。事实上,我们观察到,异构模型通常在互补的提示下取得成功,为相互学习创造了机会,而无需指定更强的老师。为了利用这种互补性,我们提出了 GRAFT(用对等轨迹对应答失败组进行门控替换),这是一种脱策略感知框架,用信息丰富的对等组替换所有失败组。 Graft 通过对等计算的优势传输成功和不成功的对等响应,同时通过序列级兼容性加权和词元级重要性比率裁剪来控制跨模型不匹配。在三个异构模型对和五个数学推理基准测试中,Graft 在每个模型部署预算相同的情况下持续改进了 GRPO 的两个模型,平均提高了 2.1 分,模型级平均性能提高了 4.5 分。存储的同伴轨迹保留了大部分收益,在没有同时协同训练的情况下平均比 GRPO 提高了 1.8 个点。