论文
KVBuffer:用于线性注意力的 IO 感知服务
KVBuffer: IO-aware Serving for Linear Attention
摘要
由于线性注意力相对于上下文长度的恒定解码成本,最近在长上下文推理中获得了极大的关注。然而,现有的服务系统通常通过在每个解码步骤中循环计算和更新大的线性注意力状态来服务线性注意力。由于状态比每个词元的键和值大得多,因此循环解码会导致大量的内存访问,并且对于服务线性注意力来说变得低效。在本文中,我们提出了 KVBuffer,一种用于线性注意力的 IO 感知服务机制。通过缓冲最近的键和值,KVBuffer 使服务系统能够以更灵活和更节省内存的方式计算线性注意力输出。对于解码,KVBuffer 支持分块计算,通过推迟状态更新并批量应用它们来减少平均内存访问和解码延迟。对于 推测解码,KVBuffer 并行验证草稿词元并避免存储临时状态。对于短上下文,KVBuffer 直接从缓冲的键和值计算注意力输出,而不创建或更新线性注意力状态。我们在 SGLang 中为 Qwen3-Next 实现了 KVBuffer。我们的评估表明,在验证四个草案词元时,KVBuffer 可以将线性注意力解码延迟降低高达 45.17%,并将 推测解码 的最大服务请求数量增加 5 倍。