论文
上下文就绪 Transformer
The Context-Ready Transformer
摘要
我们引入了上下文就绪的 Transformer,这是一种从 D 层 Transformer 块构建的新的循环神经网络架构,它在每个词元进入块之前预先对其进行上下文化。在从左到右的生成过程中,校正网络将前一个位置的块输出(过去上下文的缓存摘要)与当前词元嵌入相结合,因此词元进入已经上下文化的块,而不是作为原始嵌入。在顺序推理中,校正链使该架构成为一个循环神经网络。为了训练,我们在整个序列上展开 K 次校正过程,在每一步并行处理所有位置。通过添加零初始化校正 FFN 和 微调,预训练的 Transformer 也可以转换为上下文就绪模型。我们评估宽度、深度、块大小和两个数据集,并与标准 Transformer、变体和消融进行所有比较。 D=5 模型击败 12 层 Transformer,同时在 A100 上生成速度快 1.7 倍。当 K=10 时,单层模型 (D=1) 的推理加速比 6 层 Transformer 提高了 2.6 倍,并且顺序推理与并行 K=10 的匹配精度在 0.01 PPL 以内。该架构从广泛的表示和长的上下文中获益最多。在指针追踪任务中,使用 BPTT 训练的 D=1 解决了所有 10 个组合级别,而标准 Transformer 表现出类似楼梯的深度依赖性。