论文

转向 LLM?实际上,稀疏自动编码器可以胜过简单的基线

Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines

模型评测模型行为与机制分析

摘要

稀疏自动编码器 (SAE) 被视为探索 大语言模型 (LLM) 内部结构和生成转向模型输出的有前途的途径。当 Wu 等人引入 AxBench(模型转向基准)时。 (2025),由于相对于一组简单基线的转向性能较差,SAE 似乎没有达到最初的宣传。这项工作是对稀疏自动编码器的部分反驳,并表明 Wu 等人的结果。 (2025)并没有完全公正地对待他们。我们发现,事实上,当使用我们的监督管道选择和标记特征时,稀疏自动编码器的性能可以与 AxBench 基准上的参考 LoRA 性能接近。我们还发现,当仅使用基于可解释性的组件时,我们的管道选择的特征与其所识别的标签有着惊人的因果关系。最后,我们提出的证据表明,高稀疏性(低 l0)对于基于可解释性的成功转向可能并不至关重要,这与 Wang 等人的早期发现形成鲜明对比。 (2025)。