论文
ASPIRE:用于长上下文 LLM 推理的异步批量自推测解码
ASPIRE: Asynchronous Batched Self-Speculative Decoding for Long-Context LLM Inference
摘要
长上下文 LLM 推理受到注意力机制的瓶颈,其重复的 KV 缓存读取使解码受到内存限制。自推测解码通过稀疏注意力起草词元并以充分注意力验证它们来缓解这一问题,但现有的批处理方法保持同步:批次中的所有请求共享单个草稿验证计划,即使最佳草稿长度在不同请求之间变化很大,并且在每个请求中动态变化。我们提出了 ASPIRE,一种基于三个组件构建的非同步批量自推测解码框架。首先,统一的混合前向允许起草和验证请求在同一批前向传递中共存,从而消除了全局草案验证阶段的需要。其次,轻量级在线推测调度程序使用每个请求的接受率估计和批量感知成本模型,让每个请求独立选择何时进行验证。第三,草稿内刷新层在草稿期间对单个指定层执行充分关注,在每个草稿步骤更新稀疏上下文以减少草稿期间的陈旧性。在三个模型和五个推理和长上下文基准测试中,ASPIRE 在解码吞吐量方面比自回归基线实现了 $1.70$-$4.58\times$ 加速,并且比之前最强的自推测基线平均加速提高了约 $27\%$。