论文
您的注意力指标回答了哪个问题?作为成分数据的注意行
Which Question Is Your Attention Metric Answering? Attention Rows as Compositional Data
摘要
Transformer 的注意力矩阵的每一行都是词元上的概率分布,在训练模型中,大部分概率落在单个 \emph{sink} 词元上,通常是第一个。因此,比较注意力行的标准工具(余弦相似度、詹森-香农散度、香农熵)取决于论文很少报道的选择:保留接收器,或放弃它并重新标准化。这个选择可以推翻结论。在来自 5 个系列的 10 个预训练模型中,关于两个头中哪一个更相似的判断中有 17--47% 与惯例翻转,而标准 BERT 头聚类管道中最突出的结构就是它的产物。原因是一号摘要混合了两个问题:接收器需要多少注意力,以及其余部分如何在内容标记之间分配。将行视为组合数据将它们精确地分开:艾奇森距离正交地分裂为接收项和内容项,熵通过精确的身份分裂,并且内容距离由 Transformer 本身拥有的不变性来表征。分离在实践中很重要:训练期间测量到的大多数熵崩溃是汇增长,而不是注意力锐化(70M 参数时下降 30%,1B 时下降 95%,1.4B 时下降 79%),并且使用错误的通道修剪头部会使困惑度增加一百倍以上。我们绘制每个约定安全的位置,测试冻结的样本外预测器(一个确认,一个弃权,一个失败),并发布重新生成每个数字的代码。