论文
稀疏增量内存:通过稀疏性扩展线性 RNN 的状态
Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity
摘要
线性注意力模型允许固定的状态大小和每个词元的固定计算量。然而,由于状态大小有限,线性注意力模型在长上下文召回方面落后于基于 softmax 注意力的 Transformer 架构。增加线性注意力的状态大小可以提高召回性能,但代价是更高的 FLOPs。在这项工作中,我们引入了稀疏增量内存(SDM),这是一种使用稀疏寻址方案将门控线性 RNN 的隐藏状态扩展到更高数量级的容量的架构。 SDM 通过将密集的键值外积替换为对大型显式内存的稀疏读取和写入,扩展了门控 DeltaNet 架构。我们表明,在 isoFLOP 约束和相同数量的参数下,较高的状态记忆容量可显着提高上下文学习和长上下文检索任务的性能。此外,通过学习 SDM 存储器的初始状态并将其用作参数存储器,我们表明该模型进一步改进了广泛的常识和推理任务。