论文

稀疏自动编码器是否捕获概念流形?

Do Sparse Autoencoders Capture Concept Manifolds?

模型评测模型行为与机制分析

摘要

稀疏自动编码器(SAE)广泛用于从神经网络表示中提取可解释的特征,通常是在概念对应于独立线性方向的隐含假设下。然而,越来越多的证据表明,许多概念是沿着编码连续几何关系的低维流形组织的。这就提出了三个基本问题:SAE 捕获流形意味着什么?现有的 SAE 架构何时这样做以及如何这样做?我们开发了一个理论框架来回答这些问题,并表明 SAE 可以通过两种根本不同的方式捕获流形:全局地,通过分配线性跨度包含整个流形的紧凑原子组,或局部地,通过将​​其分布在每个特征上,每个特征选择性地平铺底层几何的受限区域。根据经验,我们发现 SAE 不能理想地恢复连续结构,将全局子空间和局部平铺解决方案混合在我们称为稀释的碎片状态中。这解释了为什么流形结构在单个概念层面上很少可见,并激发了事后无监督发现方法,这些方法寻找连贯的原子组而不是孤立的方向。更广泛地说,我们的结果表明,未来的表示学习方法应该将几何对象(而不仅仅是单个方向)视为可解释性的基本单位。