论文
Cactus:通过约束接受推测采样加速自回归解码
Cactus: Accelerating Auto-Regressive Decoding with Constrained Acceptance Speculative Sampling
摘要
推测采样 (SpS) 通过利用较小的草稿模型,成功地加速了自回归 大语言模型 的解码吞吐量。 SpS 严格强制生成的分布与验证者 LLM 的分布相匹配。这是不必要的限制,因为验证者分布的轻微变化(例如使用 top-$k$ 或温度进行采样)也是可以接受的。典型的接受抽样 (TAS) 通过使用基于熵的启发式接受更多词元来缓解此问题。然而,这种方法会扭曲验证者的分布,当验证者对关键信息进行编码时,可能会降低输出质量。在这项工作中,我们通过约束优化的视角形式化了推测采样算法。基于这个公式,我们提出了 Cactus(约束接受推测抽样),这是一种保证与验证者分布的受控分歧并提高接受率的方法。各种基准的实证结果证实了我们方法的有效性。