论文
在教师监督下预训练潜在信息反馈Transformer
Pretraining Latent Information Feedback Transformers with Teacher Supervision
摘要
Transformer 语言模型 (LM) 是前馈的:深层表示永远不会反馈到较浅层,信息跨生成步骤向下流动的唯一途径是解码的词元。这种狭窄的通道迫使模型重新计算中间结果并放弃替代的延续。在这项工作中,我们在预训练期间消除了这一瓶颈,引入了 LIFT(潜在信息反馈转换器)架构和训练方法,使 LM 能够跨代传播状态。我们通过将循环状态学习转变为教师强制的预测问题来实现这一目标:每个输入标记都与信息密集状态配对,该状态源自现成的预训练 LM 的下一个标记分布。然后使用少量附加参数扩展该模型,然后训练该模型来预测下一个标记和下一个状态。由于输入状态是预先计算的,因此预训练在各个位置之间保持完全并行。在推理时,模型自身的预测状态会被反馈,计算开销会随着模型大小的增加而减少。对参数范围从 135M 到 1B 的预训练模型进行的实验表明,LIFT 在语言建模、下游推理任务和词元匹配预算下的程序任务方面始终优于标准 Transformer 和基线,同时与计算匹配的 Transformer 持平或领先。此外,一项关于状态跟踪任务的对照研究表明,即使使用失败任务的 Transformer 的状态进行训练,小型 LIFT 的性能也优于在 8 倍以上的数据上训练的相同大小的 Transformer。总的来说,我们表明 LM 可以通过可扩展的教师监督在预训练期间学习利用从深到浅的反馈。