论文
分布回归中Transformer的泛化分析
Generalization Analysis of Transformers in Distribution Regression
摘要
近年来,基于Transformer架构的模型得到了广泛的应用,成为深度学习领域的核心工具之一。人们围绕其应用提出了许多成功的技术,例如参数高效的 微调 和高效的缩放,以进一步提高性能。然而,这些策略的成功始终缺乏严格的数学理论的支持。为了研究 Transformer 和相关技术背后的潜在机制,我们首先提出了一种由分布回归驱动的 Transformer 学习框架,以分布为输入,将两阶段采样过程与自然语言处理连接起来,并提出了称为注意力算子的注意力机制的数学公式。我们证明,通过注意力算子,Transformer 可以将分布压缩为函数表示,而不会丢失信息。此外,凭借我们新颖的注意力算子的优势,Transformer 表现出比卷积神经网络和全连接网络更强的学习结构更复杂的泛函的能力。最后,我们在分布回归框架内获得泛化界限。通过上述理论结果,我们进一步讨论了 大语言模型 (LLM) 中出现的一些成功技术,例如即时调整、参数高效的 微调 和高效缩放。我们还在我们新颖的分析框架内提供这些技术背后的理论见解。