论文

QUILT:通过共享查询执行重新思考稀疏注意力预填充

QUILT: Rethinking Sparse-Attention Prefill through Shared Query Execution

模型推理推理加速KV Cache批处理与并行

摘要

稀疏注意力降低了长上下文注意力的成本,但现有内核通常独立处理查询,重复加载和反量化跨查询共享的 KV 条目。我们观察到相邻查询选择的 KV 条目存在大量重叠,从而为跨查询重用创造了机会。我们提出了 QUILT,一种工作负载感知的稀疏注意力执行机制,它联合处理相邻查询并重用共享的 KV 条目以减少冗余内存流量和计算。 QUILT 引入了移位比较集合分解 (SCSD),它将不规则的集合操作转换为适合现代加速器的常规数据并行原语,并通过注意计算对 SCSD 进行管道化以隐藏其开销。级联共享捕获了多粒度的分层重用。切片感知执行策略平衡共享粒度与硬件切片利用率,并有选择地删除低重要性的查询特定尾部以消除未充分利用的切片。我们在 LongBench 上使用 GLM-5.3 和 DeepSeek-3.2 在两个张量下评估 QUILT 和序列并行性。与最先进的稀疏注意力内核相比,QUILT 将平均内核延迟降低了高达 55.1%,处理的 KV 数据降低了高达 55.9%,同时将首次token时间 (TTFT) 延迟降低了高达 36.8%,且精度下降可以忽略不计。