论文
构建快,评估慢:管道选择主导自动解释性分数方差
Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance
摘要
稀疏自动编码器 (SAE) 可解释性的跨论文比较通常依赖于自动可解释性分数。在此评估流程中,语言模型 (LM) 解释每个功能,另一个 LM 对解释进行评分。为了使这些比较有意义,分数必须反映特征的稳定属性,而不是评估流程的混淆方面。通过对四个指标(模拟、检测、模糊、纯度)、两个模型(Pythia-160M、Apertus-8B)和四个方法论变化轴的系统实验,我们证明这个假设并不成立。具体来说,我们发现 R1) 方法方差在所有指标和测试模型中总体上超过了架构方差; R2)每个指标都表现出明显的不稳定性特征,在所有条件下检测是最稳定的,而模糊测试是不可靠的; R3) top-k 特征排名在语料库和抽签条件下并不一致,掩盖了稳定平均分数背后每个特征的不稳定性;仅通过监视解释相似性无法检测到的故障。这些发现表明,基于自动解释性分数的跨论文比较可能反映了流程差异而不是架构差异,这对正在进行的关于 SAE 实用性的争论具有影响。更广泛地说,当需要可靠的工具来理解人工智能系统时,不可靠的评估会减缓可解释性研究的进展。为了支持评估,我们提供了方差分解方法、稳定性检查和最低报告清单。