论文

相对位置概括,绝对位置记忆:注意力长度概括的隐式偏差解释

Relative Positions Generalize, Absolute Positions Memorize: An Implicit-Bias Account of Length Generalization in Attention

模型评测模型行为与机制分析

摘要

具有相对位置编码的 Transformer 通常会推断出比训练期间看到的序列更长的序列,而具有学习绝对编码的 Transformer 通常不会。这是一个稳健的经验规律,迄今为止对其提供的解释主要是关于表达性,即是否存在长度泛化解。我们给出优化说明。在隔离位置选择的最小固定偏移检索任务中,差距由受过训练的注意力头的隐式偏差控制:在适合短序列的许多解决方案中,一个梯度下降实际选择了哪一个。我们证明旋转编码使注意力 logits 仅是相对偏移的函数,即精确的等方差,因此在训练长度上学到的任何选择规则都会在每个较长的长度上逐字再现。相反,学习的绝对编码使超出范围的位置不受约束,并且经过训练的头部固定在训练范围内的固定绝对位置。我们将学习到的旋转规则描述为与目标偏移对齐的低秩“载体”内核,并将由此产生的优雅精度衰减推导出为注意力稀释定律;这两个预测都在种子和补偿中得到了证实。线性注意力控制表明该机制特定于 softmax:在没有归一化的情况下,训练会选择不外推的最小范数插值。现象、等方差和载体都转移到在全序列长度泛化任务上训练的多层、多头 Transformer。该解释将注意力的隐性偏差、循环模型中外推的隐性偏差以及 RASP-L 猜想的学习方面联系起来。