论文
Oryx:沿词元序列切换注意力与线性递归
Multi-Mixer Models: Flexible Sequence Modeling with Shared Representations
摘要
Softmax 注意力是现代大语言模型的核心机制,但其内存需求随序列长度线性增长,计算量则呈二次增长。线性递归模型,包括线性注意力和状态空间模型,以线性计算量和恒定状态内存提供替代方案。这些词元混合算子在多种基准上具有较好的效率与效果,但在长上下文检索和上下文学习中仍落后于注意力模型。已有混合架构通常在不同层中静态交替或合并注意力与递归模块。 本文探索沿词元序列切换算子的混合方式,提出 Oryx:模型可以在同一序列中灵活切换具有二次计算量的注意力与用于高效生成的线性递归。不同算子共享至少 90% 的参数,使两种模式使用共同的内部表示。作者在最高 1.4B 参数的 Mamba-2 和 Gated DeltaNet 变体上验证设计。在固定词元预算和混合训练策略下,Oryx 达到或超过单算子基线。1.4B 规模的全部 Oryx 实例,在平均语言建模任务成绩上至少提高 0.7 个百分点;检索任务中,即使只有不足 10% 的词元使用注意力,也能取得与 Transformer 基线相当的表现。这些结果支持沿序列维度组合注意力和线性递归的架构方向。