论文

ATFlash:用于计算/内存高效 LLM 推理的每 RoPE 波长注意窗口

ATFlash: Per-RoPE-Wavelength Attention Windows for Compute/Memory-Efficient LLM Inference

模型优化稀疏化

摘要

具有旋转位置嵌入 (RoPE) 的注意力分数精确地分解为其 2D 旋转频率对的总和,并且每对旋转频率对的波长限制了它能够区分位置的程度。与此结构相一致,我们提出了每 RoPE 波长距离窗口:它将查询——关键内积项修剪到超出波长比例距离。与滑动窗口不同,每个键都保持可访问性,至少通过低频对是这样。与 MInference 等动态稀疏方法相比,缩减率与输入无关,序列长度 $N$ 具有封闭形式的对数。这样的 词元级 选择与我们的频率级别修剪正交。因此,该窗口可以应用于这些方法之上。在 Qwen2.5-0.5B 和 Llama-3.2-3B 上,窗口修剪了每个模型的本机上下文长度内的 37--48% 的查询关键内积项。相对于完全注意力,在 LongBench-v2 上下文中,top-1 匹配率保持在 96--98%,平均输出分布 KL 保持在 $10^{-3}$-nat 水平。我们检查 RULER、OpenAI-MRCR、LongCodeQA 和 $\infty$Bench 等长上下文基准的绝对分数:它们被广泛保留。我们将窗口实现为查询键收缩轴的一部分,保持 online-softmax 递归不变,并将其以最小差异移植到已发布的 FlashAttention-4 预填充和 FlashInfer 解码中。在带有 Llama 的 RTX PRO 6000 上,两个端口都超过了库存,收益随着上下文长度的增加而增长,在 128K 时高达 1.29倍。在 Qwen2.5-7B-1M 上端到端,修剪了 57\% 的内积项,在 1M 词元上下文中加速达到 $1.31\times$。