论文
从自注意力到连接拉普拉斯:Transformer 的统一算子视图
From Self-Attention to Connection Laplacian: A Unified Operator View of Transformers
摘要
自注意力是现代序列模型中普遍存在的原语,但其算子级几何结构仅被部分理解。我们将标记序列视为标记位置图上的向量场,并将注意力识别为连接行走:消息由非负行走矩阵聚合,同时通过学习的线性映射沿每个边缘传输。在此框架内,我们证明单头注意力(SHA)正是具有恒定传输的连接传播步骤,而多头注意力(MHA)正是单边依赖的连接行走,其有效传输是头向传输的注意力门控混合。我们进一步阐明了相应的生成器简化为随机游走连接拉普拉斯的条件,强调了随机性、可逆性和度量兼容传输的作用。根据经验,我们发现跨尺度(从 124M 到 8B)和结构(编码器/解码器)训练的 Transformer 表现出与我们的理论一致的几何结构:有效的注意力图收敛到更深层中的稳定几何算子,学习的传输自组织成近似尺度的等距,并且这两种现象都随着尺度一致增强。总体而言,本文提供了一种精确的连接行走形式,将自注意力与经典几何算子联系起来,以及一组用于从几何角度分析 Transformer 模型的算子级工具。