论文

CAWN:用于自回归语言建模的连续声波网络

CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling

模型架构新型架构

摘要

现代 大语言模型 (LLM) 依赖于 Transformer 自注意力,它随序列长度呈二次方缩放。最近的线性时间替代方案,例如状态空间模型(SSM),通常会在扩展上下文中遭受信号衰减的影响。我们引入连续声波网络(CAWN),这是一种完全连续的序列混合架构。 CAWN 不是基于离散矩阵的注意力,而是将隐藏状态投影到多头复杂域相量中,通过因果 $O(L)$ 相位累积机制实现序列混合。为了防止超长上下文中的信号衰减,我们引入了双门控选择性相位共振机制,该机制结合了频率相关保留、通过直通估计的硬阈值门控以及用于捕获短期局部依赖性的时间语法缓存。我们还用深度谐波卷积替换标准密集线性投影,以实现最佳空间频率混合,并通过块注意力残差进行增强,以实现深度状态路由。 CAWN 扩展到 150M 参数模型,利用自定义 Triton 内核在 float32 中实现硬件高效、复数相位累积。该原型通过 1000 亿词元语料库上的连续流循环进行训练,并在 50 亿词元里程碑上进行评估。通过目标语义检索协议进行的实证评估证明了强大的词汇获取和扩展的显式学习上下文去噪。通过分块预填充利用 $O(1)$ 状态传递,该模型检索 2,000,000 个词元中的目标信息,同时严格稳定在 8.72 GB 峰值 VRAM,凭经验克服了 $O(L^2)$ 上下文内存墙。