论文

几何墙:流形结构预测分层稀疏自动编码器缩放定律

The Geometric Wall: Manifold Structure Predicts Layerwise Sparse Autoencoder Scaling Laws

模型评测模型行为与机制分析

摘要

稀疏自动编码器(SAE)可操作线性表示假设:它们将模型激活重建为可解释字典原子的稀疏线性组合,其隐含假设是激活空间可以通过全局线性结构很好地近似。它们的重建误差在各层之间变化很大,这是现有的在单层上拟合的缩放定律无法解释的。我们认为这种变化是几何失配的经验痕迹:当激活流形是弯曲的并且其内在维度在各层之间变化时,没有稀疏线性字典可以统一匹配它,并且SAE的宽度稀疏缩放成为流形结构的层相关函数而不是单一的普遍法则。我们进行了首次跨层 SAE 缩放研究,对 Gemma 2 2B 和 9B 68 层的 844 个残差流 Gemma Scope SAE 检查点进行拟合和回归。第 1 阶段拟合每层缩放定律表面;第 2 阶段对四个分层几何汇总的拟合参数和导出的每层宽度指数进行回归。我们发现流形几何预测了两个模型中的每层宽度指数,并且在一个模型上学习的相同回归系数在跨模型转移下预测了另一个模型的每层指数,这表明可转移的几何定律。在展示层中,更丰富的宽度网格允许识别渐近层,我们发现拟合的层遵循分层几何顺序:较高的曲率和内在维度对应于更高的层,与弯曲流形的任何稀疏线性近似必须留下的不可约二阶残差一致。因此,SAE 遇到的不是有限资源的上限,而是几何相关的墙,由它们试图重建的流形设置。