论文

RL 的跨时代自适应执行轨迹优化 后训练

Cross-Epoch Adaptive Rollout Optimization for RL Post-Training

模型训练强化学习

摘要

LLM 后训练 通常依赖于对每个提示进行多次执行轨迹采样的强化学习方法,但大多数现有方法对每个提示使用固定的执行轨迹预算,尽管不同提示提供的训练信号存在很大差异。在本文中,我们研究了固定全球预算下的自适应执行轨迹分配,并将问题表述为具有即时水平递减收益的在线资源分配。我们的方法 CERO 在每个提示的成功概率上维护 Beta 后验,并使用后验预期伯努利方差作为额外执行轨迹价值的贝叶斯估计。我们使用此估计来构建累积分配上的凹形饱和效用,从而产生一个目标,其中跨提示和时期的决策与全局预算相结合。由于最终的目标在时间上是不可分离的,因此我们推导出芬切尔对偶重构,并通过预测的在线梯度下降更新即时水平和预算水平的双变量。在固定提示实用程序下,我们证明了相对于离线分配基准的 $O(\sqrt{K})$ 遗憾约束。数学推理问题的实验表明,CERO 在多个开放权重 LLM 和基准测试中始终优于 GRPO,这表明自适应执行轨迹预算可以提高样本效率。