论文
SpecRoll:用于推测性强化学习轨迹采样的快慢验证器反馈适应
SpecRoll: Fast-Slow Verifier-Feedback Adaptation for Speculative Reinforcement Learning Rollouts
摘要
强化学习(RL)后训练 提高了 大语言模型 的推理能力,但自回归轨迹生成仍然是主要的效率瓶颈。 推测解码 可以加速生成,但在 RL 期间应用它很困难,因为目标策略不断发展:静态提议者变得过时,而频繁的起草者更新会增加大量开销。我们引入了 SpecRoll,这是一种推测轨迹采样引擎,可以在两个时间尺度上进行调整的同时保留目标模型的采样分布。轻量级未来词元头生成并行提案,而我们提出的 Reflex 模块使用延迟验证器反馈来执行有界的轨迹局部隐藏状态校正,而无需反向传播。仅当检测到持续退化时,互补慢速路径才会更新磁头参数。 SpecRoll 将这些机制与并发感知稀疏树验证和精确目标验证相结合,使目标轨迹分布和 GRPO 目标保持不变。在从 1.5B 到 14B 的五个模型和三个数学推理数据集上,SpecRoll 比普通 GRPO 实现了 1.26-2.15 倍的生成加速和 1.21-2.04 倍的端到端加速。在所有 15 种匹配设置中,它的生成时间和端到端时间均优于 FastGRPO,平均成对端到端增益为 1.18 倍。受控消融表明,快速和慢速适应路径提供了互补的优势。我们的源代码位于 https://anonymous.4open.science/r/SpecRoll-26062006。