论文

状态预测分离假说

The State-Prediction Separation Hypothesis

模型架构Transformer

摘要

Transformer 使用相同的前向计算流来预测下一个词元并存储用于未来词元预测的有用状态。我们提出\emph{状态预测分离假设}:解开这两个角色可以产生更好的语言建模性能。我们设计了一个 Transformer 变体,它使用两个计算流来分离两个函数,并进行各种规模的预训练实验。我们的实验表明,状态预测分离始终提供更好的数据和计算效率,改善验证损失,并在下游任务上平均优于标准 Transformer 2--3 个百分点。我们还进行了广泛的实证分析,排除了潜在的混杂因素,并证明了我们的设计所涉及的梯度的根本差异。