论文

Maglev:滑动循环存储器

Maglev: Sliding Recurrent Memory

模型架构递归架构

摘要

我们引入了 \ours{},一种具有固定大小内存的循环 Transformer 架构,它可以概括滑动窗口注意力,同时在训练期间保持可并行性。 \ours{} 由两个耦合模型组成:预填充器 $Q$,它利用充分注意力 \footnote{在实践中,我们对 $Q$ 使用交错的完全注意力和滑动窗口注意力,因为这会产生更强的性能。基本要求是 $Q$ 比 $P$ 更具表现力,可以访问完整的历史记录。} 来生成内存目标 $m'_t$,以及解码器 $P$,它仅使用滑动窗口注意和循环 K/V 注入来生成用于下一个词元预测的解码器内存 $m_t$。我们使用内存一致性损失来训练 \ours{},将 $m_t$ 与 $m'_t$ 对齐,从而允许推理单独使用 $P$。根据经验,\ours{} 相对于滑动窗口和潜在循环 Transformer 基线改进了验证损失和下游预训练基准。此外,在 $P$ 和 $Q$ 之间共享参数可以减少参数内存,同时保留大部分增益。