论文
透过镜子:直接读写 Transformer
Through the Looking Glass: Directly Reading and Writing Transformers
摘要
Transformer 有多少个组件决定词元?根据每个单元和通道对 logits 的贡献的绝对值来计算,一次预测取决于数千到数十万个单元和通道。但贡献是有正负号的,并且在 18 个模型中,推离预测词元的质量是携带该词元的质量的中位数的七倍。除以网络,计数为数十个:在基线上,53 个组件承载了 90% 的预测,13 个组件无法在丢失后幸存,而 8 个组件足以单独产生预测。在其他地方训练的十二个模型中,有 1.24M 到 7B 个参数,足够的集合从两个组件运行到十六个组件,而预测所利用的内容,一直追溯到模型的百分之一到百分之三,这个份额不会随着大小而增长。层的更新的四分之三是其接收到的状态的固定线性映射。所有内容都是从模型自身的参数和激活中读取的,没有经过任何训练或拟合,并且它在两侧命名一个组件:它所写的内容,来自它驱动的预测,几乎达到每个模型的一半;它从自己层框架中的权重读取的内容,比其八个最强输入高出 58.9% 的机会。按上游源对剩余部分进行排序会产生嵌入无法看到的语法类别。可以根据名称采取行动。该模型不包含的关联安装到一个备用单元中,从权重中读取键和值,造成保留损失的四分之一,是一级更新成本的四十分之一。安装的注意力头和其上方两层的单元仅在上下文中较早出现的标记处才会触发编辑,并且模型为其自身训练的单元是从上游两层驱动的,86%的效果通过它。保序激活将单元的输入置于仪器的上限,而代价是两部分安装。