论文
电路索赔取决于提取的内容以及如何比较
Circuit Claims Depend on What Is Extracted and How It Is Compared
摘要
电路提取识别出一小组模型组件,这些组件的存在在消融下保留了目标行为,并且生成的电路通常被解读为该行为背后的机制。我们认为,这种解读是不确定的:保留行为并没有挑选出一个电路,因为它支持的主张取决于报告哪个电路以及如何比较两个电路。我们在综合精益策略预测基准中具体化了这一点——预测证明的下一步——其中具有随机表面形式的固定证明规则让提取的电路之间的差异归因于这些选择而不是任务。在同一 Transformer 的密集和权重稀疏检查点(大多数权重限制为零)上,根据原子(单规则)和组合(多规则)证明进行评估,我们改变报告的提取对象(紧凑的预测保留电路,还保持周围读取、写入和路由结构的更广泛的图,或者满足消融后损失阈值的最小子图),以及是否表示每个注意力头的查询和密钥共同或单独。精确的组件到组件的边缘重叠很低,并且对这些选择很敏感,有时会下降到随机基线,而两个较粗略的摘要保持稳定:选定的注意头集,以及监督检查点初始化强化学习(RL)的不同条件的电路大小排名。强化学习在组合证明方面的最大精度提升来自原子电路之外的最多结构。因此,只有在说明报告了哪个电路、用于提取该电路的修剪阈值以及比较电路的级别后,电路级声明才能得到明确定义。我们将这些要求提炼成电路提取研究的报告实践。