论文
电路凝聚:集中行为因果电路的后训练
Circuit Condensation: Post-Training that Concentrates a Behavior's Causal Circuit
摘要
机械解释的一种方法是通过电路来解释行为:承载它的组件和连接。冻结发现通常会返回数百条边,这使得它们难以彻底检查、比较或验证。我们引入了电路压缩(Circuit Condensation),它可以对模型进行后期训练,将行为集中到更小的因果图中。每轮都会修剪低属性边缘,并训练低秩适配器以通过剩余的部分来匹配原始适配器,只有在任务性能和一般能力得以保留的情况下才保留削减。在四种行为和八个模型中,压缩电路比 32 个设置中的 30 个设置中的最强冻结基线小,平均小 8.1\times$,最高可达 $316\times$。在没有权重更新的情况下重复搜索会在 32 个设置中的 29 个设置中产生更大的电路,这表明权重更新而不是单独的搜索可以推动减少。对 19 个电路的每个子集进行测试,发现 11 个电路无法简化,并揭示了其余电路中可去除的边缘。成对消融暴露了边缘之间的依赖性,表明它们的影响无法独立理解。在间接对象识别中,凝结隔离了 24 个头,其中 17 个具有已记录的角色,与匹配的冻结电路的 61 个头和 36 个未记录的角色隔离:已发布机制的充分子电路,而不是对其进行重建。由此产生的电路跟踪原始模型的下一个词元分布并预测其错误。