论文
潜在循环 Transformer:架构探索、训练策略和扩展行为
Latent Recurrent Transformer: Architecture Exploration, Training Strategies, and Scaling Behavior
摘要
我们研究潜在循环 Transformer (LRT),这是自回归 Transformer 的轻量级增强,它重用前一个词元的高级源层隐藏状态作为下一个词元的循环内存。由于这种状态已经在普通解码过程中计算出来,因此 LRT 引入了一种跨词元、跨层潜在路径,同时保留标准注意力机制、KV 缓存接口以及每个生成词元的一个模型转发。为了在不顺序展开完整序列的情况下预训练这种循环,我们引入了交错并行训练:一个全序列初始化前向构造一个共享缓冲区,然后对不相交的位置子集进行顺序细化,并在每个子集中进行并行计算。这为每个词元提供了循环内存感知的监督,大约是理想词元计算的 2 倍。在 1.3B 和 2.1B 参数 Nanochat 式骨干网和广泛的训练预算中,LRT 在匹配的有效计算下提高了 BPB 和 CORE。此外,LRT 的性能优于两前向 PonderLM-2,并与 BPB 中的三环 Transformer 相匹配,同时保留每词元一前向解码,与标准 Transformer 相比,延迟开销为 9%。