论文
Parcae:稳定循环语言模型的缩放定律
Parcae: Scaling Laws For Stable Looped Language Models
摘要
传统的固定深度架构通过增加训练 FLOP 来扩展质量,通常是通过增加参数化来提高质量,但代价是更高的内存占用或数据。一种潜在的替代方案是循环架构,它通过在循环中的层块发送激活来增加 FLOP。虽然很有希望,但用于训练循环架构的现有方法可能不稳定,会遭受残余爆炸和损失峰值。我们通过将循环重铸为残余流上的非线性时变动态系统来解决这些挑战。通过对该系统的线性近似,我们发现现有的循环架构由于注入参数中的大谱范数而出现不稳定。为了解决这些不稳定问题,我们提出了 Parcae,一种新颖的稳定循环架构,它通过负对角参数化的离散化来约束注入参数的谱范数。因此,与之前的大规模循环模型相比,Parcae 的验证困惑度降低了 6.3%。使用我们稳定的循环架构,我们研究了循环作为媒介的扩展特性,通过增加训练和测试时间的 FLOP 来提高质量。对于训练,我们推导出可预测的幂律来缩放 FLOP,同时保持参数数量固定。我们最初的缩放法则表明,在固定的 FLOP 预算的情况下,循环和数据应该同时增加。在测试时,我们发现 Parcae 可以使用循环来扩展计算,遵循可预测的饱和指数衰减。当扩展到 1.3B 参数时,我们发现与固定参数和数据预算下的强 Transformer 基线相比,Parcae 将核心和核心扩展质量提高了 2.99 点和 1.18 点,实现了高达 87.5% 的相对质量(Transformer 大小是两倍)。