论文
带分层记忆的Mamba:解决长序列建模的表征瓶颈
Mamba with Hierarchical Memory: Solving Representation Bottleneck in Long Sequence Modeling
摘要
循环线性注意力模型(RLA)如Mamba,提供了一种高效的线性时间序列建模方法,作为Transformer的替代方案。然而,它们的固定容量的循环状态限制了长序列建模。从人类记忆的层次结构中汲取灵感,我们提出Hierarchical Memory Mamba(HMM)来解决这一限制。基于预训练的Mamba基础,HMM集成了一个轻量级的工作记忆,从嵌入在基础隐藏状态中的快速感官记忆中提取慢速段落级语义(PLS)。随后,PLS被压缩成持久的长期记忆,用于任务相关的检索。在语义信息的层次处理中克服了RLA的表示瓶颈,并通过参数化学习赋予HMM跨任务的泛化能力,这是其他长上下文增强的Mamba变体中未观察到的。在Passkey Retrieval和LongBench-E任务上的评估表明,HMM在检索成功上提高了34.3%-37.1%,在推理准确度上提高了1.6%-14.2%,而仅增加了2%的额外参数,且训练开销几乎无变化。
