论文

单层模型可以进行语言建模

A Single-Layer Model Can Do Language Modeling

模型架构递归架构

摘要

现代语言模型通过堆叠层来扩展深度,每个层都保存自己的状态 - Transformer 中的每层 KV 缓存、Mamba、门控 DeltaNet (GDN)、RWKV 和 xLSTM 中的每层矩阵。生物系统严重依赖于循环而不是堆叠。我们问这个形状在语言建模上能走多远。我们提出Grounded Prediction Network(GPN)(GPN):通过单个循环块在每一步重新访问一个状态向量 - 一个 FFN,一个共享矩阵存储器。在 130M 参数下,1 层 GPN+M 达到 FineWeb-Edu 困惑度 18.06,与 12 层 Transformer++ (16.05) 的 13% 以内,与 10 层 GDN (15.34) 的 18% 以内; 2 层变体将差距缩小至 6%/11%。我们不匹配深基线。因为工作上下文是单个向量,所以我们可以直接检查它的几何形状:持久的默认词元方向、数十个词元的内容承载范围以及自发分裂为快速和慢速保留池的内存头。