论文

EchoRL:通过 Rollout Echoing 进行强化学习

EchoRL: Reinforcement Learning via Rollout Echoing

模型训练强化学习

摘要

带有可验证奖励的强化学习是后训练增强大语言模型推理能力的有效途径。然而,随着训练的进行,学习信号可能会崩溃,从而使训练增益变得微不足道且无效。具体来说,越来越多的提示的轨迹采样变得优势退化:所有自我生成的轨迹采样都显示出经过验证的成功,使得其奖励的标准偏差为零;因此,每次轨迹采样的优势也会退化(零)。鉴于此类轨迹采样的优势,模型优化的策略梯度最终消失,限制了训练性能。我们认为,其中一些轨迹采样仍然包含有价值的学习信号,但遗憾的是现有 RLVR 方法忽略了这些信号。在本文中,通过分析外部专家模型产生的黄金轨迹背后的熵模式,我们提出了 EchoRL,以更好地利用优势退化的轨迹采样来进一步提高训练性能。 EchoRL 是一个轻量级模块,它首先根据其步级熵值从已验证成功的轨迹中识别 EchoClip,然后将该剪辑反馈回 RL 目标中作为辅助监督信号。跨越 10 个基准、5 个 LLM 主干和 4 个流行的 RLVR 后训练 方法的广泛实验表明,EchoRL 以最小的开销持续改进 RLVR 后训练。