论文

模型改变主意的地方:后见之明的分歧定位,以实现高效强化学习和可验证的奖励

Where the Model Changes Its Mind: Hindsight-Divergence Localization for Efficient Reinforcement Learning with Verifiable Rewards

模型训练强化学习

摘要

具有可验证奖励的强化学习(RLVR)的与组相关的方法从rollout结果的差异中学习。独立采样完整轨迹的成本很高,并且不能明确探索关键位置的决策空间。对完整轨迹的反馈可以揭示政策重新考虑哪些早期选择,从而建议在哪里对替代延续进行采样。我们引入了后见之明发散定位(HDL),它使用后见之明引起的标记对数似然变化来选择分支点。 HDL 生成少量完整的根轨迹,并用原始任务上下文下选定位置的延续来填充每个训练组。每个延续都重用其根前缀,并仅通过其新生成的后缀贡献策略更新,从而降低生成成本,同时将额外的探索和学习集中在分支后的决策上。对数学、代码和代理任务的三个模型进行的实验表明,rollout效率和任务性能均有所提高。与组规模和训练步骤匹配的 GRPO 相比,HDL 生成的词元最多可减少 2.5$\times$,而部署挂钟时间则可加快 1.8$\times$。尽管生成预算减少,HDL 仍提高了所有三个领域的性能,在代理任务上提升了高达 12.5 个点。