论文
分析神经模型中概念表示的框架
A framework for analyzing concept representations in neural models
摘要
理解神经模型如何表示人类可解释的概念具有挑战性。先前的工作从不同的角度探索了线性概念子空间,例如探测和概念擦除。我们引入了一个统一的框架来沿着两个轴研究这些子空间:\textit{containment},它测试一个概念是否在子空间中完全表示,而不是在子空间之外;\textit{disentanglement},它测试与其他概念的隔离。在文本和语音模型的实验中,我们首先强调概念子空间可能不是唯一确定的,并讨论概念子空间分析的含义。然后,我们比较使用不同社区提出的五个估计器估计的概念子空间的属性。我们发现(1)估计器的选择会影响遏制和解缠结特性; (2) 最先进的概念擦除方法 LEACE 在两个测试轴上都表现良好,但仍难以推广到未见过的数据; (3)在HuBERT语音表示中,电话信息既包含又与说话者信息分离,而说话者信息很难包含在紧凑的子空间中,尽管与电话分离。