论文

注意力执行轨迹上 Dobrushin 约束的平等条件以及它在经过训练的 Transformer 中保持的频率

An equality condition for the Dobrushin bound on attention rollout and how often it holds in trained transformers

模型评测模型行为与机制分析

摘要

每个注意力执行轨迹因子的 Dobrushin 系数满足 $κ(\frac12(I+A))\le\frac12(1+κ(A))$,并且将这些不等式在各层上相乘就限制了整个执行轨迹的系数。当分层界限紧时,我们准确地描述:当且仅当某个token对达到 $κ(A)$ 是相互自支配的时,相等性才成立 - 两者中的每一个至少与另一个对它的关注一样强烈。该条件远非自动:均匀随机随机矩阵仅在 24-30% 的时间内满足该条件。当对每个单独输入的头部平均注意力进行测试并仅限于内容token(图像块、单词或表格特征,不包括 cls、寄存器和分隔符token)时,该条件基本上适用于 DINOv2(三种模型大小)、RoBERTa 和 DistilBERT 每一层的每个输入。在监督模型 DeiT-B 和 ViT-B/16 中,它分别适用于 91% 和 64% 的输入层对,所有故障都发生在深度后期。在使用两个标准表格基准进行训练的 FT-Transformer 中,它仅适用于 11-44% 的输入层对。特殊的token几乎可以解释 DINOv2 和语言模型中的所有失败:当包含它们时,该条件仅适用于 82-97% 的输入层对。