论文

稀疏自动编码器能否学习有意义的概念层次结构?

Do Sparse Autoencoders Learn Meaningful Concept Hierarchies?

模型评测模型行为与机制分析

摘要

稀疏自动编码器(SAE)已成为大型模型中无监督概念发现的重要工具。为了使所得的特征空间更易于解释和管理,最近的方法已经开始强加层次结构,无论是明确的还是作为训练约束的隐含效果,但严格的比较仍然很困难。对于有意义的特征层次结构应满足什么要求,没有达成一致的要求,并且评估在很大程度上依赖于具有碎片化定量协议的定性说明。为了解决这个问题,我们利用语义网络和分类学研究以及最近的 SAE 工作,得出了无监督概念发现中泛化/专业化层次结构的一组关键要求,并使用它们来得出具体的评估协议。将此协议应用于当前基于视觉数据训练的 SAE 方法,我们发现虽然特征空间通常为合理的层次结构提供基础,但建立良好的层次结构仍然具有挑战性。特别是,特征吸收,无论是众所周知的硬形式还是连续的软形式,都会系统性地损害层次结构的质量,这表明未来的方法需要解决根本性的矛盾。