论文
Softmax 注意力模型中的渐近信号子空间恢复
Asymptotic Signal Subspace Recovery in Softmax Attention Models
摘要
注意力机制在从大量词元中识别相关信息方面已经取得了显着的经验成功,但这种行为背后的理论原理仍然知之甚少。我们研究了一种程式化的 softmax-attention 模型,其中查询向量是通过随机梯度上升从信息和干扰标记的集合中学习的。利用模型的对称性,我们推导了总体目标并描述了控制学习动态的极限常微分方程。使用随机近似和动力系统理论的工具,我们在随机学习算法与其确定性极限之间建立了严格的联系。我们的主要结果表明,在适当的高维缩放假设和标准步长条件下,学习的查询几乎肯定会收敛到由潜在信息方向跨越的一维信号子空间。同样,查询渐近地将潜在信号恢复到内在符号模糊度。这些结果为理解注意力机制作为高维噪声环境中的信号提取过程提供了严格的理论基础,并提供了关于注意力如何在存在大量噪声的情况下发现相关信息的动态系统视角。