论文
通过基于压缩的内容选择的无参数自适应稀疏注意力
Parameter-free Adaptive Sparse Attention via Compression-Based Content Selection
摘要
数据自适应稀疏注意力掩模的性能大大优于固定模式(例如 BigBird 和 Longformer),甚至可以超过长序列上的密集注意力。现有的自适应方法(包括 SBM-Transformer、动态掩模注意力和 NSA)通常需要额外的可学习参数、自定义梯度估计器或专门的 CUDA 内核。我们证明经典数据压缩提供了有效的掩蔽信号,且\textbf{无附加参数}。通过计算每个块的 gzip 压缩率,我们识别非冗余内容块并有选择地通过它们路由远程注意力。直观上,gzip 无法压缩的块包含无法从局部重复中预测的信息,使它们成为自然的远程注意力目标。由于压缩配置文件依赖于输入,因此生成的稀疏掩码会动态适应内容,而无需学习参数、辅助损失或自定义内核。在 92M 参数和 8K 上下文的 PG-19 字节级语言建模中,我们的方法实现了 1.71 位/字节 (BPB),优于密集注意力 (2.89)、BigBird (2.34)、Longformer (3.21) 和重新实现的 SBM-Transformer (3.38)(唯一的学习掩码基线)高达 1.67 BPB同时不添加任何参数。优势随着序列长度的增加而增加,与 BigBird 的差距从 4K 环境下的 0.05 BPB 扩大到 8K 环境下的 0.63 BPB,而收敛速度快了 3.3$\times$。