论文
线性 RNN 缩放法则:当较长的序列击败更多的序列时
Linear RNN Scaling Laws: When Longer Sequences Beat More Sequences
摘要
自回归语言模型的经验缩放定律将预测损失与模型大小、数据大小和优化计算联系起来,但在顺序预训练设置中,它们的理论起源仍然知之甚少。我们在易于处理的师生模型中研究这个问题,其中稳定的潜在线性 RNN 生成轨迹,并通过受保护的全批量 WSD 梯度下降来训练下一个标记预测的草图线性循环学生。草图尺寸 $M$ 起着模型大小的作用,而长度 $P$ 的 $N$ 个独立轨迹提供训练标记。我们允许创新协方差和初始化协方差具有不同的幂律指数 $\alpha$ 和 $\theta$。导出的设计谱产生由谱交叉分隔的显式近似、优化和统计缩放定律。当$\theta\ge\alpha$时,原始一尺度速率$M^{1-\beta_\alpha}$、$R^{(1-\beta_\alpha)/\alpha}$和$(NP)^{-1}\min\{M,R^{1/\alpha}\}$被恢复。当 $\alpha-2r\le\theta<\alpha$ 时,较重的初始化尾部会改变超出 $P$ 依赖模型和优化交叉的速率。该证明仅在内部使用协方差事件,并在其补码上使用全局保护的步长。方差保留了因子 $(NP)^{-1}$,而序列长度也抑制了初始化瞬态,因此 $N$ 和 $P$ 在两个尺度范围内不再完全可互换。