论文
Flash PD-SSM:内存优化的结构化稀疏状态空间模型
Flash PD-SSM: Memory-Optimized Structured Sparse State-Space Models
摘要
状态空间模型 (SSM) 面临效率和表达能力之间的基本权衡,这主要由模型转换矩阵的结构决定。非结构化转换矩阵可实现最大表达能力(通过模拟有限状态自动机 (FSA) 转换的能力来衡量),但计算和内存成本却过高。相比之下,大多数结构化转换矩阵形式在运行时和内存消耗方面都非常高效,但表达能力有限。基于最近关于结构化稀疏 SSM 的工作,我们提出了 Flash PD-SSM,这是一种新颖的 SSM,其吞吐量可与广泛使用的结构化 SSM 相当,并且具有明显更好的表达性保证。 Flash PD-SSM 维护一组可训练的结构化稀疏矩阵,在每个时间步离散选择其中一个矩阵,从而实现非结构化矩阵级别的 FSA 表达能力,同时保持大规模训练模型所需的效率。首先,我们针对合成机制和状态跟踪任务的一套替代模型验证了 Flash PD-SSM,发现其理论表达能力在实践中得到了实现。其次,在涉及长度超过 17,000 的序列的多变量时间序列任务中,我们发现 Flash PD-SSM 在竞争的 SSM 方法中定义了新的最先进 (SoTA) 精度。最后,我们证明 Flash PD-SSM 是混合 LLM 的有效替代品,在自然语言状态跟踪和公共语言建模场景方面都取得了改进。与前沿语言模型中广泛使用的 SSM 相比,该模型表现出更高的吞吐量和更低的内存消耗。