论文
Raven:具有稀疏内存路由的高召回率序列建模
Raven: High-Recall Sequence Modeling with Sparse Memory Routing
摘要
线性时间序列模型中的长上下文回忆凸显了它们如何写入内存的权衡。基于状态的线性模型,例如状态空间模型(SSM)和线性Transformer,写入密集,为每个新到达的词元更新整个状态,这会导致干扰并使特定的过去词元难以恢复。滑动窗口注意力(SWA)表现出相反的行为:它通过存储显式词元表示来稀疏地写入,但仅在固定窗口内,因此一旦相关词元被驱逐,召回率就会下降。在这些模型之间进行插值,我们引入了 Raven,这是一种线性时间序列模型,它维护一组固定的内存槽,并且在每一步中,通过学习的、依赖于输入的路由仅衰减和更新选定的子集。这使得 Raven 能够减轻 SWA 基于位置的覆盖和硬驱逐,同时减少 SSM 中密集状态更新的干扰,从而更有效地保留远程内容。在召回密集型基准测试中,Raven 与之前的线性时间基线竞争或优于之前的线性时间基线,在 SWA 和 SSM 急剧退化的情况下实现了强大的长上下文召回。当外推到高达其训练长度 16 倍的上下文长度时,它仍然有效,并且在混合架构中具有类似的增益。