论文

标准化架构本身就是 4 位

Normalized Architectures are Natively 4-Bit

摘要

以 4 位精度训练 大语言模型 对于效率至关重要。我们证明 nGPT 是一种将权重和隐藏表示限制到单位超球面的架构,本质上对低精度算术更加稳健。这消除了为保持模型质量而进行的干预(例如应用随机 Hadamard 变换和执行每个张量缩放计算)的需要,并且它实现了稳定的端到端 NVFP4 训练。我们在 1.2B 密集模型和高达 3B/30B 参数的混合 (Mamba-Transformer) MoE 模型上验证了这种方法。我们将这种鲁棒性追溯到点积:虽然量化噪声在标准和归一化架构中基本上保持不相关,但信号的行为有所不同。在 nGPT 中,超球面约束增强了元素乘积之间的弱正相关性,导致隐藏维度上信号的建设性积累,同时噪声继续趋于平均。这会产生更高的有效信噪比和更平坦的损失景观,随着隐藏维度的增长,效果会增强,这表明规模优势不断增强。参考实现位于 https://github.com/anonymous452026/ngpt-nvfp4