论文

GrowMTP:在强化学习循环内从零训练草稿预测头

GrowMTP: Can RL Grow Its Own Draft Head?

模型推理投机采样

摘要

强化学习 (RL) 后训练推动了大型语言模型的前沿能力,其挂钟由自回归轨迹生成生成主导。推测性解码是解决这一瓶颈的既定补救措施,但现有的草稿头必须在 RL 之前进行预训练或预热,从而在 RL 运行之外引入大量训练成本以加速。我们观察到,RL 训练本身提供了在线草稿头训练所需的两个条件:它的 rollout 分布比预训练窄得多,并且它的验证步骤不断产生与该分布一致的监督信号。基于这些观察,我们提出了 GrowMTP,它使用这种监督完全在 RL 循环内从头开始训练草稿头,所有头更新都与策略主干分离。在 Qwen3-4B(无草案头)、MiMo-7B-SFT(弱头)和 Qwen3.5-4B-Base(强头)上,GrowMTP 分别实现了 2.13 倍、1.93 倍和 1.36 倍的轨迹生成加速,以及 1.60 倍、1.41 倍和 1.20 倍的端到端加速。因此,GrowMTP 将现有的 RL 训练框架作为模块化组件,特别是为没有预训练草图头的模型提供从头开始的加速路径。