论文
通过具有可学习混合功能的 GSS-Transformer 混合架构进行长上下文建模
Long-Context Modeling via GSS-Transformer Hybrid Architecture with Learnable Mixing
摘要
对远程依赖关系进行建模仍然是自然语言处理中的一个核心挑战。 Transformer 架构通过自注意力实现了强大的性能,但随序列长度呈二次方缩放($O(N^2)$),而状态空间模型(SSM)呈线性缩放($O(N)$),但遭受选择性召回瓶颈,难以从压缩状态中检索精确信息。这在效率和困惑度之间建立了一个基本的权衡。为了应对这些挑战,我们提出了 \textit{并行混合架构(PHA)},它运行门控状态空间(GSS)、分组查询注意(GQA)和前馈网络(FFN)作为由可学习混合机制融合的独立并行分支。 PHA 不是强迫 SSM 近似注意力或序列化两种范式,而是允许每个分支专门化:GSS 捕获全局上下文,而注意力执行选择性检索,FFN 提供补充处理。在 WikiText-103 上,PHA 在 125M 参数下实现了 16.51 PPL,优于 Hedgehog (16.70) 和 H3-125M (23.70)。扩展到 180M 参数会产生 16.42 PPL,这提供了与纯注意力基线相当的结果,同时在长上下文中吞吐量提高了 24%,内存使用量降低了 40%。在 OpenWebText 上,我们的 125M 模型达到了 19.72 PPL,优于标准 Transformer (20.60) 和 GSS 混合基线 (19.80)。这些结果表明,将序列建模范例分离为并行专家可以实现 Transformer 级的困惑,并显着提高长上下文语言建模的效率。