论文

动态短卷积改进 Transformer

Dynamic Short Convolutions Improve Transformers

模型架构Transformer

摘要

Transformer 已成为 大语言模型 的主导架构,这很大程度上归功于注意力、前馈层、残差连接和归一化的可扩展性和灵活性。本文引入动态短卷积作为改进 Transformer 的附加神经网络原语。与静态短卷积不同,动态卷积使用依赖于输入的滤波器,它保留了卷积的局部性偏差,同时提高了表达能力。激励性实验表明,与静态卷积变体相比,将动态短卷积应用于键、查询和值表示可以提高具有挑战性的联想回忆任务的性能。在从 150M 到 2B 参数的语言建模实验中,动态卷积始终优于使用静态短卷积增强的标准 Transformer 和 Transformer。拟合缩放定律表明,当动态卷积应用于键、查询和值向量时,与计算匹配的 Transformer 相比,计算优势为 1.33$\times$;而当在每个线性层之后添加动态卷积时,计算优势为 1.60$\times$。动态卷积还对线性 RNN(Mamba-2/Gated DeltaNet)和专家混合架构进行了改进。我们通过定制 Triton 内核使这些成果变得实用,这些内核可以通过可管理的端到端减速实现高效训练。这些结果表明,动态短卷积是一种可扩展、硬件高效且富有表现力的原语,可用于推进基于 Transformer 的语言模型。