论文

Transformer 线性表示高度结构化的世界模型

Transformers Linearly Represent Highly Structured World Models

模型评测模型行为与机制分析

摘要

当 Transformer 在顺序推理跟踪上进行训练时,是否会构建底层任务的内部模型?如果是这样,这些内部表示的结构是否反映了域的结构?我们在数独求解轨迹上训练 8 层 Transformer,并对其内部计算进行机械分析。我们得出两个结果。首先,该模型构建了一个子结构世界模型:它并不像人类分析师所期望的那样逐个单元地表示棋盘状态,而是围绕数独约束所作用的行、列和框组织信息。其次,我们确定了一个裸单电路:最后 MLP 层中的一小组专用神经元,每个神经元单独检测特定细胞何时可以精确地保留一个数字,并可靠地提升该数字。这些发现表明,新兴世界模型的几何形状是由域的约束代数决定的,而不是其表面​​表示,并且由此产生的决策电路是稀疏的、单一语义的且完全可解释的。更广泛地说,他们证明了机械可解释性工具可以恢复 Transformer 如何解决组合推理任务的端到端算法说明。