Transformer 表示的因果维度:测量、缩放和层结构
Causal Dimensionality of Transformer Representations: Measurement, Scaling, and Layer Structure
摘要
稀疏自动编码器 (SAE) 将 Transformer 残差流分解为可解释的特征字典,但 SAE 宽度和对模型输出的因果影响之间的关系尚未得到系统表征。我们引入因果维度 kappa(L, M, T),定义为 L 层预期雅可比外积的有效等级,并表明它可以通过 SAE 宽度扫描与归因修补配对来估计。在 Gemma-2-2B 第 12 层上从 16,384 个特征到 1,048,576 个特征的七个 SAE 宽度中,表征容量增长了 15.6 倍,而因果容量仅增长了 4.35 倍:我们将这种稳健的分离称为表征-因果楔形。饱和拟合产生的 kappa-hat 约为 1,990,kappa-hat / d_model = 0.86,参与比下限 kappa_PR 约为 280。至关重要的是,kappa 对于模型缩放是不变的:Gemma-2-9B 和 Gemma-2-2B 在相同的 SAE 宽度下产生相同的 N_causal = 328,尽管参数增加了 3.46 倍(通过校准,计数被强制为 SAE 宽度的 2%;实质性经验主张是匹配 seq=512 条件下 AtP 分数分布的形状不变性)。在八个网络深度中,kappa 是恒定的,而绝对归因阈值从第 1 层到第 23 层下降了 20 倍。五种控制(架构不变性、阈值鲁棒性、几何特权、合成 真值 恢复和四单元编码器/解码器消融)确定 kappa 测量什么和不测量什么。我们的研究结果将 kappa 确定为 Transformer 层的可测量的模型固有属性:可通过 SAE 宽度进行亚线性恢复,模型缩放不变,并且跨网络深度进行结构化。