论文
TreeSpark:用于半自回归推测解码的校准负载自适应草图树
TreeSpark: Calibrated, Load-Adaptive Draft Trees for Semi-Autoregressive Speculative Decoding
摘要
推测性解码通过让廉价的起草者提出目标模型并行验证的标记来加速语言模型推理。最近的区块起草者使起草几乎免费:单个主干通道会发出整个草案词元块。草稿树有望获得进一步的收益——在一个目标中验证了几个替代的延续——但现有的结构通过每个位置的边际对候选者进行排名,而忽略了候选者延伸的父代,因此在半自回归起草者中,更宽的树大多会添加错误排名的节点;并且固定大小的树忽略每个解码轮次和每个服务负载可以支持多少推测。我们引入了 TreeSpark,它以可忽略的成本从起草者现有的马尔可夫头读取父条件分布,将其校准为边缘接受估计,并让路径生存控制其他一切:最佳优先扩展、每轮停止和负载自适应服务策略。在不进行替换的情况下对同级进行采样,并在递归拒绝中使用匹配残差,可以在任何温度下保持解码无损。自适应树在每个温度下都会改善匹配的固定预算;与同一起草者上的调整链相比,TreeSpark 每轮接受的草稿词元多了 15-25%,单请求挂钟解码速度提高了 8-14%,并且在负载不断上升的情况下,它会优雅地将树收缩回链。代码和工件:此 https URL