论文
恢复投机解码的离策略监督
Recovering Off-Policy Supervision for Speculative Decoding
摘要
用于推测性解码的块起草者通常在外部模型编写的语料库上进行训练,其中单个离策略词元会使块中所有后续槽的监督无效。现有的方法丢弃了这些不同的时隙,导致严重的监督损失。为了在保留训练语料库的同时解决这个问题,我们提出了一个基于rollout的训练框架,通过两个互补的组件恢复全面的监督。第一个组件是锚标签重新标记(ALR),用贪婪目标rollout的分布替换语料库标签,恢复所有预测槽的有效监督。第二个组件,In-Rollout Anchors (IRA),将草图块直接放置在这些卷展栏内,以将绘图者暴露给目标生成的上下文,重用预先计算的卷展栏功能,而无需额外的目标成本。在固定视觉语言和文本语料库中,我们的框架将贪婪接受长度比 DFlash 提高了 36.5%,并且始终优于擦除基线。值得注意的是,我们方法的单个纪元超过了最佳擦除调度。三个时期后,它与目标再生响应训练的接受长度相匹配。这些结果表明,我们的框架提供了一种有效且计算效率高的方法,可以在固定语料库上训练推测性起草者,而无需修改原始文本。代码可在 https://github.com/js-lee-AI/ALR-IRA. 获取