论文
分层全局注意力(HGA)
Hierarchical Global Attention (HGA)
摘要
分层全局注意力(HGA)是预训练长上下文 Transformer 中密集因果注意力的直接替代品。 HGA 保留原始检查点参数:预训练的 $W_Q$、$W_K$、$W_V$ 和 $W_O$ 投影保持不变,不引入校准参数,不需要重新训练。应用于单个 RTX~5090 (32GB) 上的 Qwen3-30B-A3B-Instruct-2507-FP8 时,修补后的模型在 64K 词元上下文中开箱即用,其中 词元级 K/V 存储在此硬件上不可行。与之前的稀疏注意力方法不同,HGA 执行分层两级路由。它首先使用紧凑的 RoPE 感知摘要检索相关块,然后通过仅路由最相关的组来细化选择,然后再执行精确的 词元级 注意力。这种分层检索显着减少了获取的词元数量,同时保留了对检索到的词元集的精确注意力,从而使 RAM 和 NVMe 支持的存储变得实用。完整的历史词元 K/V 驻留在主机 RAM 或 NVMe 存储中,而在注意力期间只有一小部分路由工作集被传输到 GPU 内存。因此,GPU 内存消耗主要取决于模型权重和路由工作集,而不是上下文总长度。在所有测试的上下文长度(4K - 64K 词元)中,路由注意力保持在大约 $0.01$--$0.02$ 的密集注意力范围内,而所使用的稀疏度仅为 3% 左右。这些结果表明,分层路由引入的近似值很小,并且剩余的质量差距可能由长上下文位置编码主导,而不是由路由算法本身主导。