论文

Jackpot:面向极端 Actor-Policy 失配强化学习的最优预算拒绝采样

Jackpot: Optimal Budgeted Rejection Sampling for Extreme Actor-Policy Mismatch Reinforcement Learning

模型训练强化学习

摘要

大语言模型(LLM)的强化学习(RL)仍然昂贵,尤其是因为 rollout 代价高。将 rollout 生成与策略优化解耦(例如用更高效的模型来 rollout)可以带来可观的效率收益,但这样做会引入严重的分布失配,破坏学习稳定性。我们提出 Jackpot,一个利用最优预算拒绝采样(OBRS)直接缩小 rollout 模型与不断演化的策略之间差距的框架。Jackpot 整合了有原则的 OBRS 流程、一个联合更新策略模型与 rollout 模型的统一训练目标,以及由 top-k 概率估计和批级偏差校正支撑的高效系统实现。我们的理论分析表明,在可控的接受预算下,OBRS 能持续把 rollout 分布向目标分布拉近。实验上,与重要性采样基线相比,Jackpot 显著提升了训练稳定性,在以批量大小 64 训练 Qwen3-8B-Base 至多 300 个更新步时,取得了与同策略(on-policy)RL 相当的性能。综合来看,我们的结果表明,基于 OBRS 的对齐使我们朝着将 rollout 生成与 LLM 强化学习的策略优化切实有效解耦迈进了一步。

Jackpot:面向极端 Actor-Policy 失配强化学习的最优预算拒绝采样
图2:我们在(a)和(b)中进行了数值实验,其中我们用带可控噪声的随机生成的Dirichlet分布来模拟LLM的输出分布,以获得不同程度的KL散度。(a)绘制了不同actor-policy分布对之间的模拟Jackpot接受率。虽然总体趋势是随着分布相距越来越远接受率缓慢下降,但在整个范围内接受率始终保持较高 ( > 90 % >90\% )。作为参照,我们还标出了几种常见离线(off-policy)设置的actor-policy差距。在(b)中,我们展示了在我们的模拟中,Jackpot显著缩小了目标分布与所应用分布之间的KL散度,有时可缩小一个数量级。在(c)中,我们提出的方法Jackpot(黄色)在actor与policy模型概率分布之间保持较小的KL散度,而无对齐(without alignment)和TIS的KL散度均随训练继续而爆发式上升。