论文

故意离轴:Transformer 计算概念的位置及其原因

Off-Axis, On Purpose: Where a Transformer Computes Concepts and Why it Does So

模型评测模型行为与机制分析

摘要

Transformer 的答案存在于一个轴上:其非嵌入读取的方向。它的中间态基本上不会,并且离轴位置通常被视为解释的障碍。我们证明它是实用的。 12 层模型分两个阶段进行计算。通过第一个子层,每个子层都写入一个与读出几乎正交的子空间,注意力在每个深度都与它成 75 到 96 度。将注意力的值转移到读出上比匹配的随机旋转造成的损害要大 64 到 84 倍,而且损害完全在于跨标记混合:子空间将构图与词汇隔离开来。在它下面,框架本身随着深度而僵硬地转动。在第二阶段,答案在轴上延迟到达,并且是通过相加而不是通过将累积的内容转化为读数来实现的。相反,将每一层按到读数上,就像早期退出训练一样,与困惑度、LAMBADA 和 BLiMP 的基线相匹配,同时将概念阶段工作空间从大约 25 个有效维度削减到 14 个,这些基准都没有记录到这一变化。几何形状也可以被强加,尽管不是通过要求来实现的。通过损失来规定它是一种彩票:八个种子中的六个崩溃了,因为被告知将其读出投影归零的模型通过丢弃维度来遵守最便宜的命令。在相边界处插入一个固定旋转会使其达到基线质量。周围权重可以吸收的稀疏旋转集中在所有九个种子上,而普通训练的九个种子中只有五个。哪种旋转并不重要:十三个不同的运行的二十五次运行达到相同的质量,来自不同种子的两条基线将它们的概念保持在近乎正交的框架中,同时同意它们的读数。这种自由是有用的:在整个概念阶段采用训练之前随机抽取和规定的基础,质量不变。