论文
用于稀疏注意力的深度交错斐波那契间距:静态时间表击败学习扩张并在密集注意力失败的地方进行推断
Depth-Staggered Fibonacci Spacing for Sparse Attention: Static Schedules Beat Learned Dilation and Extrapolate Where Dense Attention Fails
摘要
我们研究稀疏自注意力,其中每个查询关注一个密集的局部窗口加上一组斐波那契间隔的偏移量,并使用每层标量 alpha 来压缩或扩展间隔。在一个匹配配方(60M 参数、512 个隐藏层、16 层、426M 标记)下训练的 21 个语言模型中,我们比较了四种跨深度设置 alpha 的方法:固定、每层学习、静态线性交错、该交错的 coprime(反网格)重新分配,以及范围匹配的 2 幂控制。三个结果脱颖而出。首先,静态的每层交错改善了固定和学习的 alpha 的困惑度,并且增益与基数无关:将相同的交错应用于 2 的幂基数将其提升到固定斐波那契之上,并与学习的斐波那契注意力相当。其次,每层的学习是惰性的:它不会击败静态时间表,并且成本大约是推理延迟的五倍。第三,也是最重要的,所有稀疏变体都外推到其训练长度的四倍,几乎没有退化,而配方匹配的密集基线崩溃(在 4 倍长度下,困惑度上升了 201%);我们将此归因于固定偏移注意力仅查询训练期间看到的相对位置。我们还报告了两个诚实的负面结果:在训练长度上,最佳稀疏模型的困惑度比密集基线高出约 26%,并且惊人的增益在整个上下文位置上是均匀的,而不是集中在长范围内。