论文
内在结构:机械解释的光谱可识别性
Intrinsic Structure: Spectral Identifiability for Mechanistic Interpretability
摘要
机械可解释性通过识别模型内部的电路来解释模型,但无法判断电路是模型的属性还是发现它的方法的产物。稀疏自动编码器说明了这个问题:不同的种子和宽度从相同的激活中恢复实质上不同的特征,并且没有理论表明这种变化是偶然的还是结构性的。我们将字典学习的可解释性置于可识别性的基础上。将前向传递视为一个以时间为深度的受控动力系统,并用库普曼算子提升它,得到一个有限线性实现,其 \emph{spectrum} 是模型的无坐标属性。我们证明频谱可以从 $M$ 校准样本中以 $M^{-1/2}$ 的速率恢复到排列 - 据我们所知,这是机械可解释基元的第一个可识别定理,具有匹配的极小极大下界、重尾激活的中值变体以及解离定理:只要实现是非正态的,携带激活方差的方向和携带跨深度信息的方向就不能重合。可识别的物体和可辨认的物体不是同一个物体。在 GPT-2 小、Gemma-2-2B 和 Qwen3-8B-Base 上,频谱到处收敛并达到 Qwen3-8B-Base 上的预测指数 ($0.506 \pm 0.031$);缺陷会根据每个单元格的样本阈值折叠到一条曲线上。库普曼模式击败了随机方向,但在间接对象识别上输给了主成分,正如定理所预测的那样,差距在深度距离上衰减了 $4.1\times$。库普曼谱是一个可识别的、模型固有的指纹,带有规定的误差线,而不是清晰的分解。