论文
AdaFlash:通过 同策略 蒸馏扩散绘图器实现自适应 推测解码
AdaFlash: Adaptive Speculative Decoding via On-Policy Distilled Diffusion Drafters
摘要
推测解码,其中轻量级草稿模型首先生成草稿序列,然后由目标模型验证,已成为加速 大语言模型 推理的流行范例。 DFlash 等最近的工作通过利用扩散起草器进一步提高了起草效率,其并行降噪机制可以在单次前向传递中生成草稿。在这项工作中,我们发现了扩散绘图器的一个中心陷阱:由扩散绘图器中的双向注意力和 KV 注入引起的全局依赖性是一把双刃剑。一方面赋予模型并行生成和全局上下文建模能力;另一方面,这种全局依赖性在域级别和 词元级 上都引入了高方差:不同域的接受率波动很大,并且不同草案位置的接受概率也不同。为了解决这个问题,我们提出了 AdaFlash 框架,该框架包含两个组件:(i)专为扩散绘图员量身定制的具有反向 KL 散度的 同策略 蒸馏 (OPD) 算法,可提供稳定的收敛并不断使绘图员适应部署分布; (ii) 自适应长度头,可动态调整候选长度,大大降低目标模型的验证成本。实验表明,AdaFlash 不断提高部署过程中的加速比,尤其是在高并发下,其增益尤其显着,平均吞吐量比之前最先进的方法提高了 66%。我们的代码可在 https://github.com/ZinYY/AdaFlash 获取。