论文

有理稀疏自动编码器

Rational Sparse Autoencoder

模型评测模型行为与机制分析

摘要

稀疏自动编码器 (SAE) 是机械可解释性的标准工具,但当前的 SAE 系列受到固定编码器非线性(例如 ReLU、JumpReLU 和 TopK)的限制。这将特定的稀疏性机制硬编码到模型中,并且可能会扭曲重建与稀疏性的权衡。我们引入了有理稀疏自动编码器(RSAE),它用可训练的有理函数代替了固定的编码器激活。有理激活足够灵活,可以统一近似现有 SAE 系列在紧凑域上使用的激活原语(对于 TopK,提供分离的 top-k 阈值后获得的阈值门),同时还提供更丰富的函数类以适应观察到的预激活几何形状。我们通过两阶段管道实现这个想法:初始化过程复制预训练的基线 SAE 权重,插入通过合成数据的宽松 Remez 交换获得的有理系数,并校准尺度参数以及有理系数;接下来是标准稀疏正则化重建目标下的 微调 步骤。根据经验,在三个开放权重语言模型和所有三个基线激活系列的残差流激活上,RSAE 在 微调 步骤之后在重建端指标和下游行为指标上都严格改进,而不会牺牲稀疏探测下的特征级可解释性。这些增益在跨主机语言模型、跨基线激活系列以及跨我们测试的整个基线稀疏性范围内是一致的,而升级本身只为每个自动编码器添加了少量标量参数,并且在单个消费者 GPU 上运行只需几分钟。