论文
我们什么时候可以信任稀疏镜头? SAE 忠实性 认证框架
When Can We Trust the Sparse Lens? A Certification Framework for SAE Faithfulness
摘要
稀疏自动编码器 (SAE) 越来越多地用于研究语言模型 (LM) 中的内部表示,但目前尚不清楚基于 SAE 的表示何时能够可靠地保留底层模型的预测行为。为此,我们引入了事后认证框架。在选定的层,我们用其预训练的 SAE 重建替换模型的隐藏激活,并通过这个基于 SAE 的代理导出原始冻结 LM 的预期损失的界限。生成的证书取决于对保留数据测量的三个量:代理风险、重建损失差距以及校准特征池和新输入之间的支持不匹配。我们进一步推导出一个更保守的exact-$P$扩展,其代理风险集中项在相同大小的所有特征池上是统一的。根据经验,GPT-2 Small、Gemma-2B 和 Llama-3-8B 的证书不是空的。 Llama-3-8B 的详细分层研究表明,后面的层更容易验证,这主要是由于重建保真度的提高和重建误差的下游放大较弱所致。 GPT-2 Small 显示出更弱的层依赖性,表明这种模式在模型-SAE 对之间并不通用。总体而言,该框架提供了一种实用的方法来确定 SAE 表示是否保留了足够的冻结 LM 的预测行为以支持原始模型的认证。代码位于:https://github.com/newcodevelop/sparse-lens-certification。