论文
当树不够时:使用自适应图稀疏自动编码器学习混合拓扑特征图
When Trees Are Not Enough: Learning Mixed-Topology Feature Graphs with Adaptive Graph Sparse Autoencoders
摘要
稀疏自动编码器(SAE)公开了大语言模型激活中的可解释特征,但现有的结构化 SAE 强加了单亲树或森林,而事后图允许多个亲本,但既不能指导特征学习,也不能确保可靠的关系恢复。我们引入了自适应图稀疏自动编码器(AG-SAE),这是一种结构引导的训练范例,它将每个特征的完整父集视为原子结构假设,并让证据选择零个、一个或多个父项。通过将完整的父集与空、子集和替代解释进行竞争,AG-SAE 识别共同必要的多父关系,同时拒绝冗余或虚假的替代方案,并验证每个子项的贡献是否超出其父项。然后,SAE 特征上的诱导拓扑定义了指导 SAE 训练的可微分结构损失,而拓扑引导的细化减轻了特征吸收,并使用学习结构暴露的持久重建间隙来初始化新特征。然后,通过重新评估每个特征的完整父集,从修订后的字典中再次导出整个图,从而关闭字典图自洽循环。实验证明了受控玩具模型中精确的混合拓扑恢复,比真实 LLM 激活的结构化和事后基线更高的关系可靠性和语义有效性,以及比传统 SAE 特征更强的特征级因果干预。因此,AG-SAE 将恢复的混合拓扑特征结构转变为无监督训练信号,从而改进字典,实现超越树的拓扑限制的可靠特征组织,并在重建之外表现出更强的因果控制。