从几何恢复到因果验证:稀疏自编码器特征的可重复审核,从叠加几何到因果惰性
From Geometric Recovery to Causal Validation: A Reproducible Audit of Sparse Autoencoder Features, from Superposition Geometry to Causal Inertness
摘要
稀疏自动编码器 (SAE) 是将叠加的神经表示分解为可解释特征的标准,评估主要依赖于相关恢复指标——真值 方向和解码器原子之间的余弦相似度。我们证明这混淆了两个不同的主张:解码器几何对齐和编码器激活行为。我们重现了 Elhage 等人的叠加相图。 (2022),识别出高稀疏性下的收敛伪影和极端过完备性下描述不足的扩散共享机制。我们重现了 Gau 等人的 TopK 与 L1 比较。 (2024),有 L1 收缩的直接证据。我们的中心结果是因果关系:对每个恢复的特征进行消融和转向,我们发现在退化的 SAE 中通过恢复条(余弦 >= 0.90)的特征高达 77%(在训练有素的 SAE 中为 9%)是因果惰性的:当特征存在时,匹配的原子永远不会激发,包括余弦 ~1.000 的匹配。我们将该方法打包为 sae-causal-audit,这是一种具有确定性管道的模型无关工具。重新审核完善了这一发现:惰性按原因分解为结构惰性(对映几何形状,存在于良好的 SAE 中)和竞争惰性(退化 SAE 的 TopK 病理学),按方向分解为读惰性和写惰性,其中五个对映对完全解离——不可监控但可通过同一原子操纵,操纵特异性为 143-310 附加到零消融影响。我们记录了为什么字节精确的再现性无法通过构造实现,并建议将其报告为具有明确范围的声明堆栈。将该仪器应用于生产 SAE 会以小规模(14% 惰性)重现该图案,并显示原子碰撞信号:少数原子作为与数十个不相关概念最接近的匹配而重复出现,并在三个批次中复制。