论文

通过使用随机 LayerNorm 的 Transformer 处理来跟踪可区分性

Tracing distinguishability through transformer processing with stochastic LayerNorm

模型评测模型行为与机制分析

摘要

表示相似性是深度网络分析的基础,但点值表示之间的距离本质上并不与下游函数相关:附近的状态可能会产生不同的行为,而远处的状态可能会表现相似。相反,我们给出表示量,将相似性转化为统计可区分性。重叠的随机表示必然会导致重叠的下游分布,为模型函数中的潜在比较奠定基础,并将其置于数据处理不等式等信息论工具之下。我们通过对 LayerNorm 进行轻微修改,在预训练的 Transformer 中实现了这个想法:在每次残余流读取时,我们对状态进行归一化,添加各向同性高斯噪声,然后重新归一化。在 蒸馏 微调 期间,每个残余流读取的一个学习分配参数在整个处理堆栈中分配固定的全局速率预算。生成的模型可以视为 Transformer 块,在共享的全局速率预算下以学习的有限精度读取残差流。使用 Bhattacharyya 系数,我们追踪哪些反事实区别是通过 MLP 块保留的,或者有选择地暴露于各个注意力头的查询、键和值计算。 ViT-S 和 GPT-2 Small 的实验揭示了连续视觉扰动的深度传播以及对与已知注意主题一致的标记区别的头部特异性敏感性。这些结果在 Transformer 计算上确立了作为功能性基础透镜的可区分性,补充了现有的可解释性方法。