论文

EntMTP:通过熵引导的多标记预测加速 LLM 推理

EntMTP: Accelerating LLM Inference with Entropy Guided Multi Token Prediction

模型推理投机采样

摘要

多标记预测已被证明可以增加训练期间的数据密度,提高下游文本生成质量,并作为 self-推测解码 的事实上的方法。使用 MTP 头的现有基础和开源模型在整个生成序列中致力于基于静态树的注意力拓扑,这意味着无论上下文如何,推测深度以及验证期间所需的计算都保持不变。这从根本上与自然语言的熵模式不一致,其中低熵区域通常支持可靠的多步骤起草,而高熵区域则需要更保守的推测。为了解决这个问题,我们提出了熵引导多词元预测(EntMTP),这是一种 无需训练 调度程序,它在一组特定于任务的帕累托最优树中的基于树的注意力拓扑之间进行切换,这些树以本地生成熵的运行估计为条件。通过将推测深度与上下文可预测性相匹配,EntMTP 最大限度地提高了生成文本的完整分布中的预期接受词元吞吐量,而无需牺牲生成质量。在 Humaneval、ShareGPT、GSM8k 和 Litbench 基准测试中进行评估时,EntMTP 相对 Hydra 始终实现 1.15 倍的加速,相对 Medusa 基准分别实现 1.36 倍的峰值加速。