论文
稀疏自动编码器基准可靠吗?
Are Sparse Autoencoder Benchmarks Reliable?
摘要
稀疏自动编码器 (SAE) 是 大语言模型 的核心可解释性工具,SAE 架构的进展取决于可靠地区分更好和更差 SAE 的基准。我们通过三个互补的镜头审核 SAEBench(事实上的标准 SAE 评估套件)中的 SAE 质量指标:固定 SAE 上的重新种子噪声、合成 SAE 上的 真值 相关性以及跨训练轨迹的可区分性。我们发现其中两个指标,即目标探针扰动 (TPP) 和杂散相关消除 (SCR),在其规范设置下无法满足多个镜头的要求,因此不应用于评估 SAE。其他指标显示出比现场假设的更高的重播噪声和更低的辨别性。 $k$ 稀疏探测的 sae-probes 变体是我们测试的最可靠的指标,但即使是 sae-probes 也很难分离同一 SAE 架构的变体。我们的结果表明该领域需要更好的 SAE 基准。