论文

ResonatorLM:用于高效长上下文语言建模的因果共振场混合

ResonatorLM: Causal Resonant Field Mixing for Efficient Long-Context Language Modeling

模型架构新型架构

摘要

当代语言模型以 Transformer 架构为主,该架构利用自注意力机制来实现跨广泛文档和语料库的更高效、并行的训练。这使得 Transformer 能够跨各种模式和上下文有效地对数据进行建模。然而,Transformer 以及它们的传统对应物(例如循环神经网络(RNN)和卷积神经网络(CNN))在处理长上下文时通常难以保持效率。我们引入了 ResonatorLM,这是一种用物理衍生的替代方案取代注意力的新机制。 ResonatorLM 将标记序列视为单个驱动的一维潜在场,并用阻尼谐振器的因果函数替换注意力点积。我们在传统网络架构上实现 ResonatorLM,并在标准长上下文建模任务上对其进行测试。我们发现,在小型 6M 匹配设置中,训练和预填充加速随着序列长度的增加而增加,与 32K 标记的标准优化 Transformer 相比,解码速度达到 6.47 倍,并且在 WikiText 上准确率达到 61.31%(相比之下,为 55.32%)。