论文

带分层记忆的Mamba:解决长序列建模的表征瓶颈

Mamba with Hierarchical Memory: Solving Representation Bottleneck in Long Sequence Modeling

摘要

循环线性注意力模型(RLA)如Mamba,提供了一种高效的线性时间序列建模方法,作为Transformer的替代方案。然而,它们的固定容量的循环状态限制了长序列建模。从人类记忆的层次结构中汲取灵感,我们提出Hierarchical Memory Mamba(HMM)来解决这一限制。基于预训练的Mamba基础,HMM集成了一个轻量级的工作记忆,从嵌入在基础隐藏状态中的快速感官记忆中提取慢速段落级语义(PLS)。随后,PLS被压缩成持久的长期记忆,用于任务相关的检索。在语义信息的层次处理中克服了RLA的表示瓶颈,并通过参数化学习赋予HMM跨任务的泛化能力,这是其他长上下文增强的Mamba变体中未观察到的。在Passkey Retrieval和LongBench-E任务上的评估表明,HMM在检索成功上提高了34.3%-37.1%,在推理准确度上提高了1.6%-14.2%,而仅增加了2%的额外参数,且训练开销几乎无变化。

带分层记忆的Mamba:解决长序列建模的表征瓶颈:论文配图
图2 : HMM概述。( a )认知灵感:涉及感觉、工作和长期记忆的多阶段人类记忆。( b )技术管道:通过可训练的工作记忆网络, HMM首先将预训练的Mamba隐藏状态( hth_{t} ) (类似于感觉记忆)映射到高级语义表示,通过语义编码(红色箭头,秒。 5.1 ) ,然后通过语义检索(绿色箭头,第5.2节)将其检索并广播回预训练骨干的晚期层,以增强长上下文推理的能力。