论文
内部注意力:选择性状态空间模型中的共识动态
The Attention Within: Consensus Dynamics in Selective State Space Models
摘要
选择性状态空间模型 (SSM) 最近已成为 Transformer 的引人注目的替代品,它将具有竞争力的性能与大幅提高的推理效率结合起来。在每个 SSM 层,一系列隐藏状态通过循环传播,混合不同标记的信息。尽管使用了不同的机制,这种混合所起到的作用类似于 Transformer 中的注意力。事实上,最近的工作表明,这两种架构可能比第一次出现时更接近,因为这种递归承认类似于线性注意力的公式。在 Transformer 中,众所周知,注意力会驱动词元聚集,即达成共识,在单一方向上崩溃。因此,我们要问:SSM 核心的循环是否会像 Transformer 中的注意力那样推动词元达成共识?为了回答这个问题,我们从动态系统的角度来看待 SSM,将跨层词元的演化建模为常微分方程。通过利用输入状态稳定性论证,我们建立了共识均衡的局部指数稳定性,并描述了它们对时变权重矩阵的吸引力域,这是先前结果未解决的设置。因此,我们表明 SSM 和 Transformer 之间的相似性确实更深:SSM 核心的重复性就像注意力一样聚合词元。在预训练的 Mamba-2 模型上进行的数值实验表明,输出门是调节共识程度的组件,可防止词元完全达到共识。