论文

基于概率最优传输刻画Transformer的分布表达能力

On the Expressive Power of Transformers for Contextual Relations

模型评测模型行为与机制分析

摘要

Transformer 通过使注意力成为在上下文中建模交互的中心机制,彻底改变了机器学习。尽管注意力起着核心作用,但 Transformer 表示上下文关系的理论能力仍不清楚。在这项工作中,我们通过开发基于概率和最优传输的数学框架来解决这个问题。我们将文本视为其表征的分布,将注意力视为它们之间的概率关系。这种观点揭示了注意力归一化和最优传输之间的联系:标准 softmax 归一化产生条件关系,而 Sinkhorn 归一化产生具有规定边际的联合关系。因此,这两种机制都提供了来自注意力分数的结构化概率关系。在温和的条件下,我们为这两种设置建立了通用近似结果。我们证明,具有 Sinkhorn 归一化的 Transformer 架构可以近似表示为联合概率的任意上下文关系,而标准 softmax Transformer 可以近似表示为条件概率的任意上下文关系。这些结果提供了 Transformer 对上下文关系的表达能力的数学表征,并展示了归一化的选择如何决定由注意力表示的关系的概率结构。