论文

RollVerify:核验部分生成轨迹以加速大模型强化学习

RollVerify: Bridging Efficiency and Accuracy in Long-Tail Rollout Reinforcement Learning

模型训练AI 基础设施强化学习奖励建模与过程监督分布式训练基础设施

摘要

强化学习对提升大语言模型的推理和泛化能力至关重要。它依赖大量Rollout;随着上下文窗口增大,轨迹长度的长尾特征愈发明显。在同策略训练中,这些长尾Rollout会导致GPU空闲,降低系统利用率并限制强化学习扩展性。异步或部分Rollout方法通过放宽同步要求提高吞吐,但不可避免地引入过时的离策略轨迹,可能损害最终准确率。已有方法主要在训练时对离策略样本重新加权,但与完全同策略训练相比,仍可能存在性能差距。我们不再被动地于训练中重新加权,而是提出RollVerify:一种基于部分Rollout的轻量强化学习框架,在样本进入训练之前主动验证和修复。它引入离策略偏移指标OPS,量化部分生成轨迹偏离当前策略的程度。在OPS约束下,RollVerify进行序列级和Token级核验,识别并截断无效的轨迹后缀。这样既提供有助于保持模型准确率的高质量样本,也保留部分Rollout带来的效率收益。数学与工具辅助数学推理实验表明,RollVerify可达到与同策略训练相当的准确率,同时降低训练成本。额外的代码生成结果提供了数学任务之外的初步证据。

RollVerify:核验部分生成轨迹以加速大模型强化学习:论文原图
图 3:RollVerify 概述。它通过额外的验证阶段扩展了标准的部署-培训循环。左:推出阶段;中期:训练阶段;右:建议的验证阶段。