论文

有条件联合消融:恢复 Transformer 电路中的自修复备份

Conditional Co-Ablation: Recovering Self-Repair Backups in Transformer Circuits

模型评测模型行为与机制分析

摘要

机械可解释性试图通过电路来解释 Transformer 行为:因果地支持行为的内部组件集。然而,自我修复会产生一个盲点:烧蚀主要组件可以激活休眠的备用组件,因此解释完整模型中行为的电路在用于测试它的干预下可能会变得不完整。我们将这种差距表述为条件电路完成:给定一个主要集,识别在移除后变得因果重要的组件。 We introduce conditional co-ablation (CoAx), which ranks candidates by growth in ablation effect after primary-set removal.我们表明,完全休眠的备份与每个单元完整状态分数的不相关组件无法区分,而其条件效果变化恰好聚合了将其链接到已删除集合的所有交互顺序。在 GPT-2-small 的间接对象识别 (IOI) 电路上,CoAx 以 0.941 ROC-AUC 恢复记录的备份头,而最强完整状态归因基线为 0.815,匹配条件能量控制为 0.758。对于与行为效应、输出位移和深度相匹配的替代组件组,恢复率下降至 0.40 +/- 0.13 AUC,这表明恢复率特定于已移除的电路。除了恢复之外,CoAx 选择的磁头还可以承受负载:在初次移除后冷冻它们会急剧降低 IOI 裕度,而将它们添加到不完整的电路中会将不完整性从 0.75 降低到 0.21。更广泛地说,在 4 个机制集群的 11/12 个保留实例中,条件生长与干预衍生的修复一致,并且 CoAx 完成在跨越 6 个架构系列的所有 8 个非 GPT-2 模型上优于匹配的随机完成。 Together, causal explanations of self-repairing Transformer must account for backup circuitry when primary components fail.