论文

稀疏增长 Transformer:通过渐进式注意力循环进行训练时间稀疏深度分配

Sparse Growing Transformer: Training-Time Sparse Depth Allocation via Progressive Attention Looping

模型架构递归架构

摘要

增加 Transformer 有效深度的现有方法主要依赖于参数重用,通过递归执行扩展计算。在这种范式下,网络结构在训练时间线上保持静态,并且额外的计算深度在参数级别统一分配给整个块。这种跨训练时间和参数空间的刚性导致训练期间出现大量的计算冗余。相比之下,我们认为训练期间的深度分配不应该是静态的预设,而应该是一个逐步增长的结构过程。我们的系统分析揭示了跨层从深到浅的成熟轨迹,其中高熵注意力头在语义整合中发挥着至关重要的作用。受此观察的启发,我们引入了稀疏增长 Transformer (SGT)。 SGT 是一种训练时稀疏深度分配框架,通过信息头上的目标注意循环逐步将递归从较深的层扩展到较浅的层。随着训练的发展,这种机制通过选择性地仅增加一小部分参数的深度来引起结构稀疏性。跨多个参数尺度的大量实验表明,在可比较的设置下,SGT 始终优于训练时静态块级循环基线,同时相对于标准 Transformer 主干网,将额外的训练 FLOP 开销从大约 16--20% 减少到仅 1--3%。