论文

滑动窗口注意力优于后训练改造的线性注意力

Sliding-window beats linear attention

模型评测模型能力评测

摘要

由于二次注意力的本质,大语言模型(LLM)消耗大量内存和能量。每一个新词元的成本都比前一个要高。对于每个额外的词元,键和值必须无限期地存储在内存中,这是不可持续的。人们提出了几种替代方案来解决二次缩放问题,其中之一是改造 LLM 以使用线性注意力。这个想法引起了很多关注,因为它有望以低成本、最先进的性能解决二次缩放问题。然而,这一研究方向尚未与更简单的基线进行适当的比较。在这项工作中,我们展示了带有注意力汇聚点的滑动窗口注意力(SWA)的表现与训练后的线性注意力模型一样好甚至更好。我们在各种下游任务的多个 LLM 中观察到这一点。对于长上下文推理任务(大海捞针和 BABILong),SWA 实现了更高的性能(比线性注意力高 2 到 10 倍)。 SWA不需要后训练,速度极快,并且需要低内存;因此,使其成为极其便宜且可​​靠的解决方案。为了降低推理内存成本,我们强烈建议切换到 SWA 而不是 后训练 线性模型。线性注意力模型可能已经显示出一些希望,但它们可能需要从头开始训练或进行广泛的 后训练 才能匹配 SWA。