论文

通过有界深度语法对深度 Transformer 中的层次建模进行表达性分析

An expressivity analysis of hierarchical modelling in deep transformers via bounded-depth grammars

模型评测模型行为与机制分析

摘要

人们普遍认为深度神经网络的表达能力来自于形成 \textbf{层次表示} 的能力,从而逐渐捕获跨层的更抽象和组合特征。在语言建模中,\textbf{Transformer} 已成为主导架构,早期层捕获局部句法模式,后期层编码更复杂的子句级依赖关系。虽然这种直觉塑造了模型设计,但仍然缺乏严格的理论工作来证明 Transformer 的深度如何表示这种层次结构。在这项工作中,我们通过有界深度、非递归上下文无关语法的形式镜头来分析深度 Transformer 模型的表达能力。对于此类语法,我们显式地构造具有位置注意的 Transformer,其深度随语法深度线性增长,而神经元计数随推导树形状的数量缩放,并与产生规则的数量成二次方缩放。我们的理论结果通过证明这些架构具有将抽象语法状态编码到残差流内的低维、线性可分离子空间的结构能力来支持线性表示假设。