论文

缩放定律背后的模型形状:梯度叠加视角

The Model Shape Behind Scaling Laws: A Gradient Superposition Perspective

模型训练预训练

摘要

神经缩放法则指导资源分配,但是固定参数预算应该如何在深度和宽度之间划分?受强叠加下的反宽度表示误差缩放的启发,我们通过网络的端到端响应来研究这种分配。神经特征 Ansatz 将权重和梯度几何联系起来,激发输入平均梯度外积 (AGOP) 的 Frobenius 范数 $F$ 作为响应强度和重叠的可观察值。通过重现 Anthropic 的玩具模型双下降实验,我们发现 $F$ 和测试重建损失在整个样本大小扫描中遵循近似仿射关系,并共享插值峰值。通过高斯最小范数回归实验,我们进一步表明这种相关性源于预测误差和 $F$ 共享的拟合噪声放大项。通过预训练跨越不同形状和参数预算的语言模型,我们发现在验证损失选择的最佳形状中,损失和 $F$ 之间存在很强的正相关性。这支持将有效参数分配解释为保留任务相关计算,同时减少错误响应的放大。我们的结果将误差响应放大确定为一种将梯度叠加与泛化联系起来的机制,提供了深度宽度分配和有效参数利用的功能说明。代码位于:$\hyperlink{https://github.com/wenjie1835/Shape_Scaling}{https://github.com/wenjie1835/Shape_Scaling}$。