论文

Transformer长度泛化:用精确解体积定位结构误差

Exact-Solution Volume and Length Generalization in Transformers

模型评测模型行为与机制分析

摘要

对变压器表现力的研究表明变压器是否能够解决给定的任务,但几乎没有表明该解决方案(如果学习)是否可以推广到更长的输入长度。我们通过标准化精确解体积(NESV)来研究这个问题:有界参数区域的分数,在长度为 $n$ 的每个输入上实现精确解。对于具有 $\log n$ 缩放注意力的固定宽度、单层 Transformer,我们在 NESV 上为四个任务建立渐近边界:FIRST ($Θ(1)$)、MAJORITY ($Θ(1/(n\log n))$)、INDEX ($Θ(1/n^3)$) 和 PARITY ($0$)。这些结果与之前的经验结果一致:精确解体积随输入长度衰减得越快,对该任务进行长度概括就越困难。深入研究 INDEX,我们的交易量分析揭示了两个随着 $n$ 增长的错误源。因此,我们研究了一种 Transformer 模型,该模型可以在结构上消除其中一项,理论上改进了与 $Θ(n^{-1})$ 绑定的 NESV,并且在 $10\times$ 训练 长度上进行测试时,经验上实现了 85% 的准确度,而原始模型的准确度为 60%。我们的结论是,体积分析可能是识别长度敏感性具体来源的有用方法,从而为特定任务的模型改进提供见解。