论文

消除原型:原型 SAE 的稳定性是初始化和度量设计的产物

Ablating Archetypes: The Stability of Archetypal SAEs is an Artifact of Initialization and Metric Design

模型评测模型行为与机制分析

摘要

使用稀疏自动编码器 (SAE) 的字典学习从神经网络激活中生成超完备的基础,这些基础通常是可解释的并减少了多义性。然而,SAE 的特征在随机种子之间存在很大差异——这个问题被称为不稳定性。原型 SAE(Fel 等人,2025)被提议作为一种通用的词典学习干预措施,以实现更可靠的概念提取,并在训练结束时报告更稳定的词典。我们证明了原型 SAE 所声称的稳定性是在多次运行中设置相同初始化的结果。通过我们的分析,我们试图澄清机械可解释性中可能被模糊使用的两个不同概念:稳定性是两个独立训练的模型之间的一致性,而稳定性是独立初始化的运行向共同解决方案的收敛。这种区别对于自然语言处理 (NLP) 的机械可解释性至关重要,其中特征稳定性越来越多地被用作 SAE 特征是可重用分析单元的证据。原型 SAE 的实验共享确定性 k 均值解码器初始化,在训练开始之前将运行间字典距离设置为零。当这个初始化被删除时,原型约束在我们的设置中不提供稳定性优势。我们进一步确定了一个依赖于预处理的余弦几何问题,该问题使端点稳定性指标的解释变得复杂。总体而言,我们的研究支持在更大的字典学习传统中研究 SAE 的价值,同时表明稳定性主张需要轨迹诊断和初始化消融。