论文

Transformer 残差流中的推理几何

The Geometry of Inference in Transformer Residual Streams

模型评测模型行为与机制分析

摘要

Transformer 语言模型通过连续残差更新构造预测,但表征如何逐渐指向最终结果仍不清楚。我们将中间残差状态与自身最终状态,以及来自其他上下文的最终状态经验集合比较,研究这一过程。在六个预训练语言模型中,自身终点较早就比平均替代终点更优,但许多个别终点仍然更近。这些竞争集合通常随层深缩小,但其成员会变化,剩余终点也未必彼此变得更相似。因此,方向对齐和终点排名能够改善,而到最终状态的欧氏距离却变化不大。我们建立简单高维模型,分离范数、对齐和终点几何的作用,说明渐进方向变化如何造成竞争急剧减少。我们还证明,无论采用欧氏距离还是余弦距离,沿直线走向自身终点都不会引入新的竞争者;观测到新竞争者进入,因而可以证明实际轨迹偏离直线收敛。最后,在所研究的全部模型中,与较低排名输出词元关联的终点往往在余弦距离上更远,连接了残差几何与输出组织。这些发现刻画了 Transformer 推理过程中不断增强的几何特异性,也解释了距离、竞争者数量和剩余终点集中度为何提供对同一过程的不同视角。