论文

InfoFlow:多层 Transformer 分析框架

InfoFlow: A Framework for Multi-Layer Transformer Analysis

模型评测模型行为与机制分析

摘要

虽然最近的工作已经研究了单层 Transformer 架构的近似特性,但对多层设置的严格理论理解仍然有限。在这项工作中,我们确定多层 Transformer 具有与单层完全不同的逼近能力:对于某些检索任务,任何单层 Transformer 都需要至少 $Ω(\varepsilon^{-k})$ 参数来实现精度 $\varepsilon$,其中 $k$ 随序列长度 $T$ 线性增长,而每层只有一个头的两层 Transformer最多使用 $O (\varepsilon^{-1})$ 个参数达到相同的逼近精度。为了理解这种分离,我们确定了多层近似的两种结构机制。具体来说,softmax 注意力只能有效地检索获得最大注意力分数的标记,从而在 $k \geq 2$ 的第 $k$ 次最大检索中产生指数长度的参数成本。此外,解码耦合信息的参数成本与检索到的词元集的大小成比例。受这些发现的启发,我们提出了 InfoFlow,一种多层 Transformer 框架。该框架跟踪每个词元和层的可访问输入位置的信息集,为每种信息传播模式分配明确的近似率。这种抽象恢复了已知的近似界限,与训练网络上的实验观察保持一致,并在目前直接理论分析难以处理的环境中产生具体的预测。我们的结果为推理多层 Transformer 的近似效率提供了一个原则框架。