论文
T^2MLR:具有时间中间层递归的 Transformer
T^2MLR: Transformer with Temporal Middle-Layer Recurrence
摘要
Transformer 推理受到自回归解码的限制,自回归解码通过标记空间重复压缩丰富的隐藏计算,并使中间推理状态难以跨时间持续。我们引入了具有时间中间层递归(T2MLR)的 Transformer,这是一种基于 Transformer 的潜在推理架构,它将前一个词元的缓存中间层表示直接融合到当前词元位置的较早层中,使抽象中间计算能够在解码步骤中持续存在,而推理开销很小。在自然语言预训练和多跳推理微调方面,T2MLR 始终优于数据和参数匹配的 Transformer 基线。此外,仅将递归应用于局部中间层块(少至网络的 20%)通常优于全层递归。重要的是,T2MLR 不需要从头开始预训练:将循环路径改造为现有的预训练 1.7B Transformer 并进行短暂微调,可显着改善数学推理,降低实际采用的障碍。这些结果表明,Transformer 中的有效潜在推理不需要像以前的工作那样在所有层上循环,而是可以从目标中间层递归中更强烈地出现。