论文

Transformer 跨层表示的轨迹几何

Trajectory Geometry of Transformer Representations Across Layers

模型评测模型行为与机制分析

摘要

理解 Transformer 表示如何跨层演变,而不仅仅是它们编码的内容,仍然是机械可解释性中的一个悬而未决的问题。我们利用计算神经科学的几何工具,通过高维表示流形将 Transformer 前向传递重新塑造为离散群体轨迹。我们不是探测预先指定的特征,而是使用直接在环境空间中计算的五个指标来表征轨迹几何:轨迹长度、曲率、语义收敛指数、分层余弦相似度和表示稳定性。在三个模型系列(GPT-2、TinyLlama、Qwen2.5)和五个受控提示系列中,我们报告了四项发现。首先,语义相关的提示在中后期层显着收敛(峰值 CI 0.41--0.58,p<0.001,Mann-Whitney U),与吸引子动力学一致。其次,推理任务产生比词汇变化曲率更大的轨迹(0.71--0.83 rad vs. 0.27--0.31 rad),这表明曲率编码了计算复杂性。第三,模糊标记表现出轨迹分叉,最后一层的表示分离高达 5.6 倍,而在明确控制中则不存在。第四,分层余弦相似性揭示了一个通用的三相结构:编码、细化和输出准备,在所有三种架构中都是一致的。所有四种效果在洗牌层和随机嵌入控制下消失。我们发布了一个完全开源的、与模型无关的管道,并认为轨迹几何构成了一个有原则的、无探针的透镜,用于机械解释。