论文
打破熵界限:通过 MTP 和拒绝采样加速 RL 训练
Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling
摘要
强化学习 (RL) 已成为现代 大语言模型 的关键组成部分,但采样轨迹阶段仍然是 RL 训练流程的关键瓶颈。尽管多词元预测 (MTP) 提供了一种通过 推测解码 加速采样轨迹的自然解决方案,但许多研究发现,MTP 接受率在 RL 训练期间显着下降,导致加速性能有限。为了解决这个瓶颈,我们在 LLM 后训练 中提出了 Bebop,这是对 MTP 的系统研究,并提供了将 MTP 集成到大规模 RL 管道中的实用方法。首先,我们揭示了 MTP 接受率基本上受到模型熵波动的限制,这表明与 RL 阶段熵的上升存在明显的负线性关系。其次,我们表明,与贪婪草图采样相比,概率拒绝采样很大程度上减轻了强化学习中熵引入的干扰。我们进一步发现,传统的 MTP 训练目标(交叉熵或 KL)在这种设置中并不是最优的,因此我们提出了一种新颖的端到端 TV 损失,它可以直接优化多步拒绝采样接受率,产生约 10% 的接受率改进,在数学推理、代码生成和代理任务中实现高达 95% 的接受率和高达 25% 的额外推理吞吐量增益。第三,我们在 RL 期间测试了各种在线 MTP 训练策略,结果表明,使用 e2e TV 丢失和拒绝采样进行 RL 前 MTP 训练在整个 RL 中实现了一致的接受率和加速,从而消除了昂贵的在线 MTP 更新的需要。我们提供广泛的实验和分析来验证我们的发现。实验结果表明,我们的方法在 Qwen3.5、Qwen3.6 和 Qwen3.7 模型的异步 RL 训练中实现了高达 1.8 倍的端到端加速。