论文

块稀疏注意力的不确定性门控选择

Uncertainty-gated selection for block-sparse attention

模型推理推理加速

摘要

块稀疏注意力通过将 O(N^2) softmax 替换为关键块上的每个查询前 k 个选择来扩展长上下文语言模型。这种截断是短视的:当第 k 个和第 (k+1) 个区块的分数几乎相等时,选择器会在不花费额外预算的情况下提交,并且携带答案证据的丢弃区块在下游无法恢复。我们提出了一个信息值路由器,用于测量每个查询的 top-k 切割的决定性,并将差距最小的查询的保留集加倍;该规则与主干网无关,并与现有的块评分方法(例如 Quest)叠加。在 n=215(整个数据集子集)的 LongBench-v2 介质上,router-on-Quest 达到配对召回率 0.75,而 top-k 为 0.47——在 SSA 式基线上+28 pp(McNemar p<0.01)——并且在相同上下文中在 RULER NIAH 多密钥上达到密集的 2 pp 以内。该电梯复制了三种架构的四种型号(Qwen2.5、Mistral-Nemo、Qwen3.6)。在 128K 时,路由器在 Qwen2.5-7B-1M 和 Qwen3.6 上保留了 0.81 和 0.89 的密集精度(而前者上的 SSA 式 top-k 为 0.09),而融合选择加内核管道以 0.62 倍和 0.80 倍的密集墙时间运行。