论文
AdaPLD:自适应检索和重用,实现高效无模型 推测解码
AdaPLD: Adaptive Retrieval and Reuse for Efficient Model-Free Speculative Decoding
摘要
推测解码 通过在单个目标模型前向传递中验证多个起草的词元来加速生成,从而减少顺序解码迭代。无模型变体通过重用生成过程中已有的文本和模型状态来避免辅助草稿模型,但它们的加速取决于构建草稿的可靠性。我们确定了现有的基于重用的方法的两个局限性:词汇锚定检索在表面形式变化下的召回率有限,并且当检索到的上下文不能唯一确定延续时,确定性跨度复制可能很脆弱。我们提出 \emph{AdaPLD},一种 无需训练 方法,可以自适应地改进检索和草稿构建。 AdaPLD 保留了高精度词汇重用,同时使用语义相似性在词汇匹配失败时恢复额外的重用机会。它进一步构建分支重用假设来解释连续的不确定性,而不是依赖于单个复制的跨度。在不同的基准测试中,AdaPLD 减少了目标模型前向传递,并实现了高达 3.10倍$ 的解码加速。