论文

超越统一学分分配:RLVR 的选择性资格追踪

Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR

模型训练强化学习

摘要

带可验证奖励的强化学习(RLVR)已成为提高 大语言模型 推理能力的关键方法。然而,广泛使用的无批评算法,例如组相对策略优化(GRPO),需要“统一贡献分配”假设,不加区别地传播轨迹级别的优势,由于无法区分关键推理步骤而阻碍了学习效率。为了解决这一限制,我们提出了选择性资格追踪(S-trace)。基于部分信任区域保留的直觉,我们最初引入 P-trace 作为一种样本高效、无批评家的资格追踪方法,在此基础上我们构建了 S-trace,实现稀疏资格追踪机制,以进一步减轻方差并通过选择性屏蔽低熵词元来实现细粒度的贡献分配。理论上,我们将最近的组序列策略优化(GSPO)方法置于无批评者资格跟踪框架内,将其识别为在统一学分分配下运行的资格跟踪方法的特殊实例。实验表明,S-trace 不仅优于 GRPO,在 Qwen3-1.7B 上显示出 0.49\% 的增益,在 Qwen3-4B 上显示出 3.16\% 的增益,并且在平均 pass@16 中进一步扩展到 Qwen3-8B 时保持了 2.98\% 的稳健改进,而且值得注意的是,它同时实现了更高的样本和词元效率。