论文
作为时间相关 Wasserstein 梯度流的多头 Transformer 架构
Multi-Headed Transformer Architectures as Time-dependent Wasserstein Gradient Flows
摘要
近年来,Transformer 架构彻底改变了语言处理领域,为以前无法预见的可能性打开了大门。然而,从理论角度来看,文献中提出的数学模型往往缺乏与实际架构的直接联系,并且依赖于强简化假设。在本文中,我们通过将多头 Transformer 架构中的数据流建模为时间相关的梯度流来缩小这一差距,以获取合适的交互能量来捕获注意力机制的设计。对时间的明确依赖使我们能够考虑每个头和每个层的不同权重,而不会对初始化方法施加限制。此外,我们证明,在权重演化的适当可积性假设下,梯度流 $ω$-limit 集的每个元素都是限制权重分布处相互作用能量的驻点。最后,我们考虑初始数据和权重的扰动来分析梯度流的稳定性。具体来说,一方面,我们研究了所提出的模型对于噪声输入的鲁棒性,建立了梯度流对初始数据和流的唯一性的连续依赖性。另一方面,我们证明了扰动相互作用能与未扰动相互作用能的$Г$收敛,从而导致相应梯度流的收敛。我们用数值实验补充了这些理论结果,证实了预测的能量耗散特性,并阐明了在类自治(奥恩斯坦-乌伦贝克)和真正非自治(振荡权重)状态下动力学的渐近行为。