论文
PARD-2:双模 推测解码 的目标对齐并行拔模模型
PARD-2: Target-Aligned Parallel Draft Model for Dual-Mode Speculative Decoding
摘要
推测解码 通过使用轻量级草案模型来提出由目标模型并行验证的候选词元,从而加速 大语言模型 (LLM) 推理。然而,现有的 模型训练 目标草案与最大化连续词元接受的推理时间目标并不直接一致。为了解决这个问题,我们重新制定了模型优化目标草案,将重点从词元预测准确性转移到整体接受长度。在本文中,我们在 PARD 的基础上提出了 PARD-2,这是一种具有置信度自适应词元 (CAT) 优化的双模式 推测解码 框架。这种方法自适应地重新加权每个词元,以更好地与验证过程保持一致。值得注意的是,PARD-2 使单个草案模型能够支持目标相关和目标无关模式。跨不同模型和任务的实验表明,PARD-2 在 Llama3.1-8B 上实现了高达 6.94$\times$ 的无损加速,超过 EAGLE-3 1.9$\times$,超过 PARD 1.3$\times$。我们的代码可在 https://github.com/AMD-AGI/PARD 获取。