论文
关于Transformer中位置编码的几何
On the Geometry of Positional Encodings in Transformers
摘要
神经语言模型处理单词序列,但其中的数学运算对单词出现的顺序不敏感。位置编码是为了解决这个问题而添加的组件。尽管位置编码很重要,但其设计很大程度上是通过反复试验而设计的,没有关于它们应该做什么的数学理论。本文发展了这样一个理论。确定了四个结果。首先,任何没有位置信号的 Transformer 都无法解决任何对词序敏感的任务(必然性定理)。其次,在温和且可验证的条件下(位置分离定理),训练将不同的向量表示分配给每个全局最小化器的不同序列位置。第三,信息最优编码的最佳可实现近似是通过位置分布之间的 Hellinger 距离上的经典多维缩放(MDS)构建的;任何编码的质量都是通过一个数字来衡量的,即压力(命题 5,算法 1)。第四,最佳编码具有有效等级 r =rank(B) <= n-1 并且可以用 r(n+d) 个参数而不是 nd (最小参数化结果)来表示。附录 A 通过五个引理,针对掩码语言模型 (MLM) 损失、序列分类损失和满足位置充分性条件的一般损失,在神经正切核 (NTK) 机制内提出了单调性猜想的证明。基于 BERT 的 SST-2 和 IMDB 实验证实了理论预测,并揭示了线性偏差注意力机制 (ALiBi) 实现的压力比正弦编码和旋转位置嵌入 (RoPE) 低得多,这与近似平移等变性下 MDS 编码的秩为1 解释一致。