论文

超越目标:《推测解码》从模仿到合作

Beyond the Target: From Imitation to Collaboration in Speculative Decoding

模型推理投机采样

摘要

推测解码 (SPD) 通过让较小的草稿模型提出多个由较大目标模型并行验证的未来词元来加速 大语言模型 (LLM) 推理。占主导地位的 SPD 范式将目标模型视为唯一可靠的老师,仅当草案词元与目标预测完全匹配时才接受草案词元。这种设计隐含地假设目标在每个位置都是更好的选择。实际上,这个假设并不成立。虽然草案总体上是较弱的模型,但它在 词元级 上并不完全逊色。在草稿和目标不一致的相当一部分情况下,草稿的选择是导致正确的最终答案的选择。受此启发,我们引入了 \textbf{Collaborative 推测解码 (CoSpec)},它是 SPD 的泛化,不再将目标模型视为唯一的 词元级 权威。 CoSpec 通过强化学习训练仲裁策略,以决定是否接受草稿或目标模型中的词元,在不匹配时选择性地接受草稿词元,因为这样做可能会产生正确的最终答案。实验结果表明,CoSpec 保持了显着的加速,同时超越了仅目标性能。通过将重点从模仿转向协作,CoSpec 提出了对 推测解码 的新视角。