论文
测量位置决定测量内容:基于消融的 SAE 评估中的位置选择
Where You Measure Decides What You Measure: Position Selection in Ablation-Based SAE Evaluation
摘要
稀疏自动编码器旨在命名语言模型计算的事物,检查潜在问题的常用方法是将其关闭并查看发生了什么变化。但是潜伏会在许多标记上触发,并且必须在其中之一上测量其效果。惯例是衡量潜在火灾最严重的地方。这种选择几乎从未被报道过,而且它也不是由实验者做出的:它是由正在评估的字典做出的。更改字典,测量就会移动到不同的标记。我们证明这不是一个细节。采用谷歌为同一模型发布的两个稀疏自动编码器,并通过解码器相似性来匹配它们的潜在特征:即使在两个字典编码几乎相同的对中,它们也会为其中很大一部分选择不同的标记。因此,在通常的协议下比较的两个字典经常在不同的地方进行比较。为了将约定与字典分开,我们从一次初始化中训练了六个自动编码器,仅在拟合选择上有所不同,因此每个自动编码器中的潜在含义相同。这种比较的大部分方差读作“这些词典对这个潜在变量的看法不一致”,结果却是位置:一旦每个词典都以相同的标记进行测量,方差就会从 7.6% 和 11.9% 下降到接近零。更多的评估数据并不能拯救它。在 16 倍的语料库大小范围内,词典对于测量位置的共识较少,而不是更多,因此问题随着规模的扩大而加剧。更正的是一行评估代码。我们为该协议提供了一个基于消融的因果数,该因果数必须报告为在论文之间具有可比性,并对五篇已发表的论文进行了审计。简而言之:报告的因果数没有其位置,描述了它被获取的标记与它被获取的潜在标记一样多。