论文

树 SAE:学习稀疏自动编码器中的分层特征结构

Tree SAE: Learning Hierarchical Feature Structures in Sparse Autoencoders

模型评测模型行为与机制分析

摘要

学习稀疏自动编码器 (SAE) 中的分层特征对于捕获现实世界数据的结构化性质和缓解特征吸收或分裂等问题至关重要。现有的工作试图通过依赖激活覆盖来识别独立特征集中的层次关系,假设子特征只应在其父特征激活时激活。然而,我们证明仅此条件是不够的;也就是说,当父级和子级概念在语义上不相关时,它经常会产生误报。为了解决这个问题,我们引入了一种新颖的重建条件,可以在层次结构级别之间加强更深层次的功能联系。通过结合激活和重建约束,我们提出了 Tree SAE,这是一种旨在直接从特征集中学习层次结构的模型。我们的结果表明,Tree SAE 在学习分层对方面显着超越了现有的 SAE,同时在几个关键基准上保持了最先进的竞争性能。最后,我们展示了 Tree SAE 在映射子特征子空间的几何形状和揭示 大语言模型 中编码的复杂分层概念结构方面的实用性。