论文
Sessa:选择性状态空间注意力
Sessa: Selective State Space Attention
摘要
现代序列建模主要由两个系列组成:Transformer(其自注意力可以访问可见序列的任意元素)和结构化状态空间模型(其通过显式循环状态传播信息)。这些机制在长上下文中面临不同的限制:当注意力分散时,单个词元的影响会在有效支持中被稀释,而除非主动保存信息,否则循环状态传播可能会失去长程敏感性。因此,这两种机制都面临着在长上下文中保存和选择性检索信息的挑战。我们提出了 Sessa,一种将注意力放在循环反馈路径内的解码器。这创建了许多基于注意力的路径,通过这些路径过去的词元可以影响未来的状态,而不是依赖于单个注意力读取或单个循环链。我们证明,在明确的假设和匹配的制度下,Sessa 承认幂律记忆尾部 $O(\ell^{-β})$ 对于 $0 < β< 1$,其衰减速度比相应的 Transformer 和 Mamba 式基线慢。我们进一步给出了实现该幂律率的显式构造。在相同的假设下,Sessa 是被认为实现灵活选择性检索的唯一模型类,包括其影响力不随距离衰减的配置文件。与这一理论优势一致,在匹配的实验中,Sessa 在长上下文基准上实现了最强的性能,同时在短上下文语言建模上与 Transformer 和 Mamba 风格基准保持竞争力。