论文

等级、头通道不可识别性和对称性破缺:Transformer 中表征崩溃的精确分析

Rank, Head-Channel Non-Identifiability, and Symmetry Breaking: A Precise Analysis of Representational Collapse in Transformers

模型架构Transformer

摘要

Dong 等人广泛引用的结果。 (2021) 表明,仅通过自注意力构建的 Transformer,没有跳过连接或前馈层,会遭受快速的秩坍缩:所有词元表示都收敛到一个方向。提议的补救措施是 MLP。我们表明,这张图虽然在董所研究的体系中是正确的,但在对架构理解很重要的方面是不完整的。建立了三个结果。首先,层归一化精确地是仿射秩中性的:它准确地保留了标记表示集的仿射秩。人们普遍认为闪电网络“没有发挥任何作用”,这种说法并不准确。正确的说法是比较尖锐的。其次,在测度理论意义上,残余连接通常会阻碍真实 Transformer(例如 BERT-base)中的秩崩溃,而无需 MLP 的贡献。 MLP 的不可替代功能是不同的:在原始标记嵌入的线性范围之外生成特征方向,这是任何注意力层堆栈都无法产生的。第三,识别出与等级崩溃不同的现象:头部通道不可识别性。在多头注意力通过输出投影对每个头的输出求和之后,个体贡献不能被规范地归因于特定的头;当从混合信号中恢复单个头时,每层的 n(H-1)d_k 自由度仍然不明确。 MLP 无法解决这个问题,因为它作用于求和后信号。提出了一种建设性的部分补救措施:参数开销低于标准输出投影 1.6% 的位置门控输出投影 (PG-OP)。文献中确定的四种塌陷现象——深度的等级塌陷、宽度的等级塌陷、头通道不可识别性和熵塌陷——在对称破缺框架下统一,每种现象都对应于 Transformer 前向传递的独特对称性。