论文

AsyncTLS:具有异步两级稀疏注意力的高效生成 LLM 推理

AsyncTLS: Efficient Generative LLM Inference with Asynchronous Two-level Sparse Attention

模型推理KV Cache

摘要

LLM 中的长上下文推理面临着二次注意力复杂性和令人望而却步的 KV 缓存的双重挑战。虽然 词元级 稀疏注意力提供了卓越的准确性,但其索引开销非常昂贵;块级方法提高了效率,但牺牲了精度。我们提出了 AsyncTLS,这是一种分层稀疏注意力系统,它将粗粒度块过滤与细粒度词元选择相结合,以平衡准确性和效率,再加上异步卸载引擎,该引擎通过时间局部性利用将 KV 缓存传输与计算重叠。在跨 GQA 和 MLA 架构的 Qwen3 和 GLM-4.7-Flash 上进行评估,AsyncTLS 实现了与完全注意力相当的准确性,同时在 48k - 96k 上下文上实现了 1.2 倍 - 10.0 倍的算子加速和 1.3 倍 - 4.7 倍的端到端吞吐量改进。