论文

EfficientRollout:用于 RL轨迹采样的系统感知自推测解码

EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts

模型推理投机采样

摘要

强化学习(RL)已成为大语言模型(LLM)的代表性后训练范式,实现了强大的推理和代理能力。然而,采样轨迹生成仍然是主要的延迟瓶颈,因为自回归 (AR) 采样按顺序解码响应,并且少量的长尾生成通常决定完成时间。 推测解码 (SD) 是一种用于服务固定 LLM 的成熟技术,它通过快速起草词元并通过并行验证接受它们来减少延迟,同时保留目标模型分布。然而,它的实际加速并不会直接延续到强化学习的轨迹采样中:(i)不断变化的目标政策使得任何固定的起草者与政策的输出分布越来越不匹配; (ii) 在整个解码过程中,活动批次大小不断缩小,将解码从计算限制转移到内存限制状态,其中并行验证可以利用未充分利用的计算。因此,加速RL轨迹采样既需要起草者在不断发展的政策的长期高温生成下保持有效,又需要系统感知的 SD 使用,以避免计算受限的制度。我们推出了 EfficientRollout,这是一个系统感知的自我 SD 框架,旨在解决 RL轨迹采样的这一差距。 EfficientRollout 从目标模型(即 self-推测解码)中引入量化起草者,使其与不断发展的策略保持耦合,而无需单独的起草者预训练或在线适应。它进一步协调系统感知的 SD 切换策略与接受感知的草稿长度调整,仅在有益的制度中进行推测,同时将起草预算与不断发展的起草者质量相匹配。与加速 AR轨迹采样基线相比,EfficientRollout 分别将轨迹采样和端到端延迟减少了 24.2% 和 15.6%,同时保持了最终模型质量。