论文
深层中的值向量是否需要来自残差流的上下文?
Do Value Vectors in Deep Layers Need Context from the Residual Stream?
摘要
Transformer 架构的成功很大程度上归功于其注意力层的使用。注意力层遵循标准神经网络范例:它将残差流作为输入,从而生成上下文相关的查询、键和值向量。然而,我们发现,当更深的层仅学习上下文无关的值向量来保留原始标记信息而不利用残差流中的任何上下文时,模型性能会显着提高。当模型可以访问这个与上下文无关的值向量时,添加回上下文相关的组件对于总体基准性能几乎没有带来额外的好处。这种上下文无关的值向量可以存储为稀疏模型参数,从而无需重新计算或持久缓存这些值。通过对此类上下文无关价值向量的关键设计选择进行系统性消融,我们提出了价值银行(BoV),这是一种通过学习最后三分之一层中每个层的特定于词元的价值向量的查找表来计算注意力中价值向量的新方法。在 135M 和 780M 模型中,BoV 改善了标准注意力的验证损失,并且在 780M 时,21 个基准的平均得分,与之前以更少的计算和内存将词元信息添加到值向量的最佳方法相匹配。