论文

在循环Transformer中用深度换取时间

Trading Depth for Time in Recurrent Transformers

模型架构递归架构

摘要

循环Transformer通过时间循环增加计算深度,将每个标记的高级隐藏状态输入到下一个标记的计算中。这就提出了一个自然的问题:额外的计算是否更好地花在更多的时间步骤或更大的物理深度上?我们使用潜在循环Transformer(LRT)研究这个问题,它在解码过程中为每个词汇标记保留一个骨干前向传递,并提供一种受控设置来比较这两种添加计算的方法。具体来说,我们在连续的词汇标记之间插入一个潜在的思想标记。每个思想标记都经过与词汇标记相同的 $L$ 层,共享主干参数,并在预测下一个标记之前提供隐藏状态细化的附加阶段。我们将这个 $L$ 层 LRT 与没有思想词元的 $2L$ 层 LRT 进行比较。两者在解码期间都对每个词汇标记执行 $2L$ Transformer 块,但思想标记模型使用较少的参数。在 16 层和 20 层专家混合 NanoChat 主干上,一个思想词元将较浅的模型带到了其双深度模型每字节 0.006 和 0.004 位的范围内,恢复了 67% 和 81% 的改进,总参数减少了约 48%。这些结果表明,时间思维为增加循环变形金刚的物理深度提供了一种参数有效的替代方案。