论文

从稀疏自编码器特征构建的领域过滤知识图谱

Domain-Filtered Knowledge Graphs from Sparse Autoencoder Features

模型评测模型行为与机制分析

摘要

稀疏自编码器(Sparse Autoencoders,SAEs)能从语言模型中提取数百万个可解释特征,但扁平的特征清单本身用处不大。领域概念与通用特征及缺少明确概念依据的特征混杂在一起,相关概念散布在众多单元中,而且没有办法理解特征之间的关系。我们通过以下方式解决这一问题:首先利用对比激活和多阶段过滤流程,从大型SAE特征清单中构建严格的领域特定概念全集。接着,我们在过滤后的集合上构建两个对齐的图视图:一个是以多级粒度组织、刻画语料级概念结构的共现图;另一个是基于transcoder的机制图,通过稀疏潜在通路连接源层与目标层特征。随后,自动化边标注把这些图视图变成可读的知识图谱,而不是无标注的布局。在一本生物学教科书的案例研究中,这些图恢复了连贯的章与子章级结构,揭示了衔接相邻主题的概念,并将包含数千个特征的杂乱句子级活动转化为紧凑、可读、能展示模型局部活动的视图。综合起来,这项工作把扁平的SAE特征清单重构为内部知识图谱,将特征级可解释性转化为模型知识的全局地图,并支持对推理忠实性的审计。

从稀疏自编码器特征构建的领域过滤知识图谱:论文配图
图 1:共享坐标激活图在多个尺度上恢复教科书结构。章节面板显示了代表性章节的不同全局盆地,而呼吸系统子章节面板显示了共享章节区域内重叠但仍然可区分的局部模式。