论文
从原子到树:用分层稀疏自编码器构建结构化特征森林
From Atoms to Trees: Building a Structured Feature Forest with Hierarchical Sparse Autoencoders
摘要
稀疏自编码器(SAE)已被证明能有效从大型语言模型(LLM)中提取单语义特征,但这些特征通常被孤立地识别。然而,广泛的证据表明LLM捕捉自然语言的内在结构,其中“特征分裂”现象尤其表明这种结构是分层的。为捕捉这一点,我们提出分层稀疏自编码器(Hierarchical Sparse Autoencoder,HSAE),它联合学习一系列SAE及其特征之间的父子关系。HSAE通过两种新机制强化父特征与子特征之间的对齐:结构约束损失和随机特征扰动机制。跨多个LLM与层的大量实验表明,HSAE能持续恢复语义上有意义的层级结构,这得到定性案例研究和严格定量指标的双重支持。同时,HSAE在不同字典规模下保持标准SAE的重构保真度与可解释性。我们的工作为发现和分析LLM表示中嵌入的多尺度概念结构提供了强大且可扩展的工具。
