论文
CompactAttention:通过 Block-Union KV 选择加速分块预填充
CompactAttention: Accelerating Chunked Prefill with Block-Union KV Selection
摘要
分块预填充已成为长上下文 大语言模型 广泛采用的服务策略,但在这种情况下有效的注意力计算仍然具有挑战性。现有的稀疏注意力方法主要是为一次性预填充而设计的,并且不能有效地转换为分块预填充:当查询长度受块大小限制时,块稀疏内核会降低效率,而当在每个块上累积的 KV 缓存上重复时,细粒度模式搜索会变得昂贵。 QUOKA 是一种直接针对分块预填充的最新方法,避免了稀疏内核开销,但依赖于查询子采样、词元级 KV 选择,这可能会错过特定于查询的 KV 条目并引入显式 KV 复制开销。为了解决这些限制,我们提出了 CompactAttention,一种基于 Block-Union KV Selection 的分块预填充注意力机制。 CompactAttention 将 2D 块稀疏掩码视为 KV 选择信号,而不是直接的稀疏内核执行计划,并通过 Q 块并集和组内并集将其转换为 GQA 感知的每组 KV 块表。这种构造生成最小块表,该表在分页执行约束下保留输入掩码选择的所有 KV 块,从而无需显式 KV 压缩即可就地访问所选 KV 块。在 LLaMA-3.1-8B-Instruct 上,CompactAttention 在 RULER 基准上保持接近密集注意力的准确性,同时在分块预填充下在 128K 上下文长度下提供高达 2.72$\times$ 的注意力加速。