论文
Jackpot:面向极端 Actor-Policy 失配强化学习的最优预算拒绝采样
Jackpot: Optimal Budgeted Rejection Sampling for Extreme Actor-Policy Mismatch Reinforcement Learning
摘要
大语言模型(LLM)的强化学习(RL)仍然昂贵,尤其是因为 rollout 代价高。将 rollout 生成与策略优化解耦(例如用更高效的模型来 rollout)可以带来可观的效率收益,但这样做会引入严重的分布失配,破坏学习稳定性。我们提出 Jackpot,一个利用最优预算拒绝采样(OBRS)直接缩小 rollout 模型与不断演化的策略之间差距的框架。Jackpot 整合了有原则的 OBRS 流程、一个联合更新策略模型与 rollout 模型的统一训练目标,以及由 top-k 概率估计和批级偏差校正支撑的高效系统实现。我们的理论分析表明,在可控的接受预算下,OBRS 能持续把 rollout 分布向目标分布拉近。实验上,与重要性采样基线相比,Jackpot 显著提升了训练稳定性,在以批量大小 64 训练 Qwen3-8B-Base 至多 300 个更新步时,取得了与同策略(on-policy)RL 相当的性能。综合来看,我们的结果表明,基于 OBRS 的对齐使我们朝着将 rollout 生成与 LLM 强化学习的策略优化切实有效解耦迈进了一步。
