论文

超越一袋特征:稀疏自动编码器中的集合级不稳定性

Beyond a Bag of Features: Set-Level Instability in Sparse Autoencoders

模型评测模型行为与机制分析

摘要

沙尼等人。 (2026) 表明 LLM 表示广泛地恢复了人类类别边界,但未能反映细粒度的典型性结构。他们的分析使用密集模型表示的余弦相似度。我们重新审视他们的方法,使用主动稀疏自动编码器(SAE)潜在集的重叠作为更可解释的相似性度量。我们首先验证这种集合级度量是有意义的:SAE 潜在集可以在受控玩具模型中恢复类似联合的组合结构,并在自然文本中引入语义连贯的邻域。将人类概念分析扩展到 SAE 集相似性,我们发现 SAE 激活集并没有比密集嵌入或残差流状态更忠实地恢复人类类别边界或类别内典型性,而是跟踪模型内部相似性结构。为了进一步探讨这一差距,我们研究了良好控制的语义修改下的活跃潜在集,揭示了人类对概念变化的判断与 SAE 活跃集变化的判断之间存在很大的不匹配。我们将此解释为证据,表明在理想化设置之外,SAE 特征不是通过简单的特征包语义组成的。