论文

DeepLo​​op:循环 Transformer 的深度缩放

DeepLoop: Depth Scaling for Looped Transformers

模型架构递归架构

摘要

循环 Transformer 通过在多轮中应用紧凑的物理块堆栈来扩展顺序计算,在不增加存储参数的情况下增加展开深度。这种重用改变了残差缩放问题:在未绑定的 Transformer 中,每个残差分支接收并应用自己的参数更新,而在循环 Transformer 中,一个共享更新聚合来自重复访问的梯度,并由下一个线性化前向传递中的相同访问读回。我们通过由访问对齐系数 $κ_R$ 控制的一阶扰动界限来形式化这种束缚深度效应。当访问去相关时,界限恢复 DeepNorm 指数,但在保守的对齐机制中,随着循环计数以固定物理深度增长,它要求指数从 $1/4$ 增加到 $1/2$。由此产生的方法 \textbf{DeepLo​​op} 保留 Post-LN DeepNorm 架构,并为展开深度 $N$ 设置 $α=(2N)^{1/2}$ 和 $β=(8N)^{-1/2}$。在 GPT-2 小规模和 GPT-2 中规模的 GPT 式循环语言模型上,当没有重新访问物理块时,DeepLo​​op 是中性的,一旦激活循环深度,就会改善验证损失和下游准确性。这些结果表明,稳定的循环深度需要考虑参数访问的剩余缩放规则,而不仅仅是名义层数。