论文
大规模解锁门控 Delta 网络中的特征学习
Unlocking Feature Learning in Gated Delta Networks at Scale
摘要
训练和扩展 大语言模型 需要大量的计算资源,从而激发了高效的次二次架构和有原则的超参数调整方法。虽然最大更新参数化 ($μ$P) 已经为标准 Transformer 实现了零样本超参数传输,但其对线性模型的扩展,特别是那些具有结构化状态转换和复杂架构的模型,在很大程度上仍未得到探索。通过前向传播、门控机制和循环状态动力学严格传播坐标大小估计,我们推导出门控 Delta 网络的缩放规则。语言模型 预训练 上的实验证实,我们的配置可以在 AdamW 和 SGD 下实现跨模型宽度的稳定学习率迁移,而标准参数化则无法迁移,从而验证了我们分析的正确性和实用性。