论文
通过拓扑表示对神经网络概念进行操作抽象
Operational Abstractions of Neural Network Concepts via Topological Representations
摘要
基于概念的方法为解释和操作学习的表示提供了语义级别,但现有的编辑方法通常专门针对特定的干预措施,并且不提供概念组织的通用且可编辑的表示。为了实现这一目标,我们引入了拓扑概念表示(TCR),这是一种事后操作抽象,共同描述了学习表示中编码的概念及其关系。 TCR 从概念可恢复性和交互分数构建中间概念空间,并通过拓扑对其组织进行紧凑编码。干预是通过对该抽象的修改来表达的,这些修改会传播回底层的学习表示。这允许不同的概念级操作共享相同的优化框架,并将所需的概念组织与实现它的机制分开。我们建立了 TCR 的稳定性和重新参数化不变性及其与现有概念编辑公式的联系。我们使用 TCR 来解开概念,作为现有擦除方法的预处理步骤,在可比概念泄漏的情况下,将最差组准确率平均提高 21.89。我们进一步使用 TCR 将概念从教师模型转移到学生模型模型,将概念可恢复性提高高达 5.54,同时还提高或保持竞争性测试 top-1 准确性。
