论文

理解稀疏自动编码器的鲁棒性

Towards Understanding the Robustness of Sparse Autoencoders

模型评测安全与风险评测

摘要

大语言模型 (LLM) 仍然容易受到利用内部梯度结构的基于优化的越狱攻击。虽然稀疏自动编码器(SAE)被广泛用于可解释性,但它们的稳健性影响仍未得到充分探索。我们提出了一项在推理时将预训练的 SAE 集成到 Transformer 残差流中的研究,无需修改模型权重或阻止梯度。在四个模型系列(Gemma、LLaMA、Mistral、Qwen)和两种强大的白盒攻击(GCG、BEAST)以及三个黑盒基准测试中,SAE 增强模型相对于无防御基线,越狱成功率降低了 5 倍,并降低了跨模型攻击的可转移性。参数消融揭示了(i)L0 稀疏性和攻击成功率之间的单调剂量响应关系,以及(ii)依赖于层的防御实用性权衡,其中中间层平衡鲁棒性和清洁性能。这些发现与代表性瓶颈假设一致:稀疏投影重塑了越狱攻击所利用的优化几何结构。