论文
Circuit-Diff:基于事实编辑的归因图中知识本地化干预方法
Circuit-Diff: Factual Edit-based Intervention Method for Localizing Knowledge in Attribution Graphs
摘要
机械可解释性将特征定义为神经网络的基本单元,将电路定义为执行其计算的加权子图。由于单个神经元是多语义的,因此引入了跨层转码器 (CLT),作为通过生成归因图来近似模型电路的方法。然而,该图的节点是未标记的特征:读取图意味着修剪它,然后手动计算出每个幸存节点的含义。为了使 CLT 更容易用于电路发现,我们引入了 Circuit-Diff,它通过低秩的事实编辑来干预模型本身,并将在该编辑下在归因图中的角色发生变化的特征视为与编辑的知识相关。在我们检查的编辑中,标记的节点不仅是对象标记的检测器:读取 CLT 发布的功能仪表板,它们还包括历史、地理以及围绕新旧对象的关联的功能。我们将方法形式化,测量事实编辑后冻结的 CLT 的可靠性,通过将选定的节点修补到最多 24 个 CounterFact 编辑来测试它们,提供案例研究,并发布基于电路跟踪器包的开源实现,以及两个其他工具(多提示聚合和基于规则的超级节点标记)。