论文

使用稀疏自动编码器发现数百万个可解释的特征

Discovering Millions of Interpretable Features with Sparse Autoencoders

模型评测模型行为与机制分析

摘要

稀疏自动编码器(SAE)已成为将叠加语言模型表示分解为稀疏且可解释特征的强大工具。然而,训练 SAE 的计算成本很高,而且可用的开源 SAE 模型仍然有限。在这项工作中,我们引入了 \textbf{Qwen3-Instruct SAE},这是一套在 Qwen3 指令调整模型系列上训练的综合 SAE 套件,涵盖 Qwen3-1.7B、Qwen3-4B 和 Qwen3-8B。对于 Qwen3-1.7B 和 Qwen3-4B,我们在三个关键激活位点训练分层 SAE:残差流、MLP 输出和注意力输出。对于 Qwen3-8B,我们在残余流层的子集上训练 SAE。我们使用激活级重建指标和模型级恢复指标系统地评估这些 SAE,揭示了不同层和组件之间不同的稀疏性和保真度权衡。最后,我们通过拒绝引导案例研究展示了 Qwen3-Instruct SAE 的实用性,表明选定的 SAE 特征可以因果地将指令调整的 Qwen3 模型引导向拒绝行为。我们的版本为研究指令调整语言模型中的稀疏表示、特征级机制和行为干预提供了实用资源