论文

Draft-OPD:同策略 蒸馏 用于推测草案模型

Draft-OPD: On-Policy Distillation for Speculative Draft Models

模型推理投机采样

摘要

推测解码 通过将目标模型与轻量级草案模型配对来加速 大语言模型 推理,该轻量级草案模型的提议词元经过并行验证。构建草稿模型(例如 EAGLE3 或 DFlash)的常见方法是在目标生成的轨迹上监督 微调 (SFT)。然而,我们观察到 SFT 很快就趋于稳定:草稿模型对测试数据的接受长度停止改善。原因是离线到推理不匹配:在 SFT 中,绘图者从固定目标生成的轨迹中学习,而在 推测解码 中,它是在根据其自己的策略提出的块上进行评估的。这会激发 同策略 蒸馏 (OPD),其中目标模型在起草引起的状态上监督起草者。然而,OPD 对于草案模型来说仍然很困难,因为它们无法可靠地独立轨迹采样完整的序列,而目标辅助生成使收集的序列遵循目标分布,从而消除 同策略 信号。因此,我们提出 Draft-OPD,它使用目标辅助轨迹采样来实现稳定的延续,并从验证暴露的错误位置重放起草。这使得起草者能够从接受和拒绝的提案的目标反馈中学习,将训练重点放在限制推测性接受的草案引起的错误上。实验表明,Draft-OPD 对跨不同任务的思维模型实现了超过 5 倍的无损加速,比 EAGLE-3 和 DFlash 分别提高了 23% 和 13%。