论文

C$^{2}$R:跨样本一致性正则化减轻稀疏自动编码器中的特征分裂和吸收

C$^{2}$R: Cross-sample Consistency Regularization Mitigates Feature Splitting and Absorption in Sparse Autoencoders

模型评测模型行为与机制分析

摘要

稀疏自动编码器 (SAE) 广泛用于通过将激活分解为稀疏的、人类可理解的特征来解释 大语言模型,但扩展到大型字典会带来根本性的挑战。系统研究揭示了普遍存在的特征分裂,将连贯的概念分解为非原子潜在的概念,以及广泛的特征吸收,在一般特征中产生了任意的例外,严重损害了潜在的可靠性。这些问题源于样本间不一致的潜在分配:在没有跨样本约束的情况下,每个样本的优化通常允许单个底层概念在多个冗余或干扰潜在中不一致地分布。为了解决这个问题,我们引入了 C$^2$R (\underline{\textbf{C}}ross-sample \underline{\textbf{C}}consistency \underline{\textbf{R}}正则化)。 C$^2$R 明确鼓励每个语义特征通过批次中的统一潜在变量一致地表示,通过惩罚方向相似潜在变量的共同激活。综合评估表明,C$^2$R 有效地减轻了分裂和吸收,同时最重要的是保持了重建保真度,提供了一个原则性的解决方案,可以在不降低模型性能的情况下增强潜在的可解释性。源代码位于 https://github.com/hr-jin/Cross-sample-Consistency-Regularization。