论文
超级高铁 Transformer
Hyperloop Transformers
摘要
LLM 架构研究通常旨在根据固定的计算/延迟预算最大限度地提高模型质量。然而,许多感兴趣的应用程序(例如边缘和设备上部署)进一步受到模型内存占用的限制,从而激发了语言建模的参数高效架构。本文描述了一种提高 LLM 参数效率的简单架构。我们的架构利用循环 Transformer 作为核心原语,它跨深度重用 Transformer 层,因此比普通(深度匹配)Transformer 更具参数效率。我们将循环的 Transformer 组织成三个块——开始块、中间块和结束块——其中每个块本身由多个 Transformer 层组成,并且只有中间块在深度上循环应用。我们用超连接增强了循环中间块(Xie et al., 2026),将残余流扩展为矩阵值残余流。超连接仅在每个循环之后应用,因此添加最少的新参数和计算成本。在各种模型尺度上,我们发现,与深度匹配的 Transformer 和 mHC Transformer 基线相比,我们的超连接环 Transformer(Hyperloop Transformer)能够表现良好,尽管使用的参数减少了大约 50%。通过 后训练 权重量化,这种性能得以持续,从而将 Hyperloop Transformer 定位为内存高效语言建模的有吸引力的架构。