论文
门控循环 Transformer:通过循环调制表达深度
Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation
摘要
扩展 Transformer 语言模型会在表达能力和记忆效率之间产生内在的张力。虽然跨层的独特权重保留了功能专业化(从输入基础到抽象细化),但它们会占用大量内存。相反,标准深度共享会强制执行统一转换,从而破坏表征多样性并降低建模质量。我们引入了门控循环 Transformer,这是一个循环深度 Transformer,其中固定深度的前奏和尾声块包含单个共享核心迭代 R 次。受门控循环神经网络的启发,我们采用轻量级投影和元素更新门(以隐藏状态、固定前奏输出和每一步重新采样的噪声为条件)来调制循环更新。这允许模型将输入专门化到重复的相同几个层,而不是需要许多独特的层来实现功能多样性。在 isoFLOPS 约束下,3 层门控循环 Transformer 与具有类似训练和推理 FLOP 的 12 层 GPT-2 Small 基线的精度相匹配,并在所有 9 个按预算规模的单元中领先 MoR 和重尾深度采样;在中型和大型规模下,它接近标准 词元预算 的密集质量,并且一旦预算翻倍,就在中等规模下超越它。在 isoPARAMS 约束下,较深的递归实现了 2.76 的验证损失,而在匹配的参数和数据预算下,非循环对应的验证损失为 2.84。我们的结果表明,自适应深度重用是一种以参数换取质量的原则性策略:在大规模情况下,参数减少 63%,峰值解码内存减少 59%,编译生成延迟增加 10%。