论文
SpotAttention:用于预训练长上下文的插件块稀疏路由 Transformer
SpotAttention: Plug-In Block-Sparse Routing for Pretrained Long-Context Transformers
摘要
长上下文已成为预训练 LLM 中的标准,但它们的运行成本仍然很高:预填充计算随序列长度呈二次方增长,并且每个解码步骤都会重新读取与其线性增长的键值缓存。稀疏注意力通过仅关注过去标记的相关子集来降低这些成本,但选择该子集本身就是昂贵的。我们提出了 SpotAttention,一种轻量级选择器,它附加到冻结的预训练 Transformer 上,并通过 KL 蒸馏 学习来估计其注意力分布。选择器选择每个查询涉及的前 K 个键,并且由于其估计是校准分布,因此双 top-p 规则直接从中读取每个查询、每个层的预算。在 Qwen3(密集,4B-32B)和 Qwen3.5(混合线性/完全注意力,4B-9B)中,SpotAttention 在高达 128K 标记(训练长度的八倍)的上下文中匹配密集精度。 L=128K 下的解码运行速度比 FlashAttention 快 3.9 倍,比 Twilight(最强的 无需训练 基线)快 1.8 倍。将选择器的 K 缓存量化为 INT4 或 FP4 微尺度,可将其缩小 3.5 倍,而不会造成任何精度损失。