论文

从原子到树:用分层稀疏自编码器构建结构化特征森林

From Atoms to Trees: Building a Structured Feature Forest with Hierarchical Sparse Autoencoders

模型评测模型行为与机制分析

摘要

稀疏自编码器(SAE)已被证明能有效从大型语言模型(LLM)中提取单语义特征,但这些特征通常被孤立地识别。然而,广泛的证据表明LLM捕捉自然语言的内在结构,其中“特征分裂”现象尤其表明这种结构是分层的。为捕捉这一点,我们提出分层稀疏自编码器(Hierarchical Sparse Autoencoder,HSAE),它联合学习一系列SAE及其特征之间的父子关系。HSAE通过两种新机制强化父特征与子特征之间的对齐:结构约束损失和随机特征扰动机制。跨多个LLM与层的大量实验表明,HSAE能持续恢复语义上有意义的层级结构,这得到定性案例研究和严格定量指标的双重支持。同时,HSAE在不同字典规模下保持标准SAE的重构保真度与可解释性。我们的工作为发现和分析LLM表示中嵌入的多尺度概念结构提供了强大且可扩展的工具。

从原子到树:用分层稀疏自编码器构建结构化特征森林
图1:使用 HSAE 的层次化特征发现。我们展示学习到的特征森林中的一棵树,以及其节点的语义仪表盘。每个节点包含唯一的特征索引(例如 #1059)、人工标注的语义标签,以及若干最具激活性的代表性上下文片段。橙色高亮表示激活位置,颜色深浅反映激活强度。HSAE 捕捉到清晰的概念分类体系:一个表示 Science、Technology 和 Research 的宽泛父特征(#1059)被系统地分解为更专门的特征,如 Scientific Disciplines(#4015)。这个中间节点进一步分支为一个捕捉包含单词 science 或 scientists 的词汇模式的特征(#12268),以及一个表示 biology 或 physics 等具体学科名称的特征(#12975)。为清晰起见,仅展示了三层子图和部分特征的示例。