论文

莫比乌斯学习:Transformer 中的循环深度折叠

Mobius Learning: Cyclic Depth Folding in Transformers

模型架构Transformer

摘要

基于 Transformer 的语言模型沿着有序的深度轴组织计算,其中浅层和深层块通常形成不同的表示角色。我们挑战传统观点,即这些角色必须与有序序列中的块位置保持联系。我们介绍莫比乌斯学习,一种基于循环深度折叠的训练架构,其中不同的数据流遵循循环移位的块顺序。因此,相同的块组在某些数据流的块序列的早期应用,而在其他数据流的晚期应用,因此它在浅层和深层角色中都得到了优化,这种现象我们称为深度角色叠加。令人惊讶的是,在使用 Muon 在 2.5B FineWeb 词元上训练的修改后的 GPT-2 小型 (124M) 模型的四人实验中,Mobius Learning 在大量 Transformer 块序列传递中实现了比固定顺序循环 Transformer 更低的验证损失。这一违反直觉的结果表明,块组不需要保持局限于块序列内的一个固定的浅层或深层角色,并且打开了基于循环深度折叠的新设计空间。至关重要的是,这种结构使莫比乌斯学习特别适合内存受限的分布式训练:原始训练数据保留在本地,而每个工作器存储一个块组而不是完整的 Transformer 块堆栈。