论文
BubbleSpec:利用同步强化学习的长尾空闲时间生成推测性采样草稿
BubbleSpec: Turning Long-Tail Bubbles into Speculative Rollout Drafts for Synchronous Reinforcement Learning
摘要
强化学习(RL)已成为提高大语言模型(LLM)性能的基石。然而,它的采样轨迹阶段构成了一个显着的效率瓶颈,主要是由于数据并行队列中的长尾泡沫引起的,特别是在长上下文场景中,更快的 GPU 在等待落后者时保持空闲。现有的解决方案(例如部分采样轨迹或异步强化学习)通过损害算法的严格同步特性来减少这些泡沫。相反,我们提出了 BubbleSpec,这是一种新颖的框架,可以加速 RL 的采样轨迹,同时严格保持数学准确性。 BubbleSpec 并没有试图消除气泡,而是利用它们。我们利用更快排名的空闲时间窗口来预先生成后续步骤的采样轨迹结果,作为 推测解码 的草稿。与之前依赖于历史纪元相似性和预热的推测方法不同,BubbleSpec 与数据集大小无关,并且从训练开始就提供立即加速。广泛的评估表明,BubbleSpec 将解码步骤减少了 50%,并将采样轨迹吞吐量提高了 1.8 倍。重要的是,BubbleSpec 能够与各种 RL 框架和策略无缝兼容,因为它维持了 RL 算法的严格同步特性。