论文
混合验证解码:学习在推测解码中分配验证
Hybrid Verified Decoding: Learning to Allocate Verification in Speculative Decoding
摘要
大语言模型 (LLM) 的生成仍然很昂贵,因为自回归解码为每个新词元调用一次模型。 推测解码 通过起草多个词元并在一步中使用目标模型验证它们来降低这一成本,但其加速取决于有多少起草的词元被接受。无参数草稿源可以在结构化和代理工作负载中以低成本提出长期延续,但在一个生成步骤中看起来很有希望的缓存匹配在下一个生成步骤中可能会产生较低的回报。我们提出混合验证解码,它在验证之前预测缓存草稿的可接受长度,并使用此收益估计在缓存验证和基于模型的起草器之间进行选择。在三个 LLM 和 16 个数据集上,混合验证解码对于代理工作流程尤其有效,它在每种设置下都优于 EAGLE3,平均加速率为 2.73 倍。我们的分析展示了提示结构如何创造缓存机会,高回报缓存草稿如何集中在草稿空间的一小部分,以及回报引导选择如何减少顺序解码工作,指出运行时草稿选择是 推测解码 的一个有希望的方向。