论文
LT2:线性时间循环 Transformer
LT2: Linear-Time Looped Transformers
摘要
循环 Transformer (LT) 已成为一种强大的架构,在解码最终词元之前多次迭代其层。然而,将它们与充分注意力配对会保留二次复杂度,使它们的计算成本昂贵且缓慢。我们引入了 LT2(线性时间循环 Transformer),这是一系列循环架构,用次二次线性时间注意力取代二次 Softmax 注意力。我们研究了两种变体:具有线性注意力的 LT2-线性和具有稀疏注意力的 LT2-稀疏。我们发现循环与这些变体具有独特的协同作用:它能够在线性注意力中实现迭代记忆细化,并逐步扩大稀疏注意力中的有效感受野。我们从理论上形式化了这些好处,并在受控回忆、状态跟踪和语言建模任务中展示了一致的经验收益。然后我们探索 LT2-hybrid,它在循环设置中结合了不同的注意力变体。两个变体特别有前途:LT2-hybrid (GDN+DSA),它交织线性和稀疏注意力以最大限度地提高效率,并以完全线性时间成本匹配标准循环 Transformer 的质量; LT2-hybrid(Full+GDN),它将 GDN 与一小部分全注意力层交织在一起,以最大限度地提高质量,在性能和效率上都超过了标准循环 Transformer。我们还展示了如何将预训练的 LT 转换为 LT2 混合模型。通过大约 1B 词元的训练,我们的转换模型 Ouro-hybrid-1.4B 的性能优于行业级 1B 模型,并且与行业级 4B 模型具有竞争力,同时保留了线性时间注意力的速度优势。总之,这些结果显示了一条使循环 Transformer 更具可扩展性并推进高效、强大的小语言模型的清晰路径。