论文

多种电路,一种机制:电路发现中的输入变化和评估粒度

Many Circuits, One Mechanism: Input Variation and Evaluation Granularity in Circuit Discovery

模型评测模型行为与机制分析

摘要

电路发现方法识别解释模型行为的子图,所发现的电路之间的结构差异通常被解释为不同机制的证据。我们通过在保持任务固定的情况下改变输入词元频率来测试这个假设。在结构上进行比较时,发现的电路似乎按频率专门化,但功能和代表性分析没有显示相应差异的可靠证据。我们将这种不匹配的幻象专业化称为“不匹配”。使用跨四个频段的文字序列复制任务加上频率加权控制,我们从五个 Pythia 模型 (70M-1.4B) 中提取了 75 个电路。我们发现结构不同的电路实现相同的计算:特定频段的边缘在频段之间广泛传输,大多数频段共享的核心在 70M 以上的模型中恢复了至少 99% 的电路性能,并且因果交换干预证实了内部表示在频段之间是可互换的。较小的主谓一致性复制显示了相同的模式:电路在结构上有所不同,但在频带之间广泛转移,并且大多数频带共享的核心恢复了几乎所有电路精度。同一频带内的重复提取进一步表明发现算法从有效子图的等价类中进行采样,而不是恢复独特的机制。标准评估实践掩盖了这种模式:源级评估夸大了明显的 忠实性,而边缘级评估则揭示了从结构到功能的多对一映射。我们不会在组件内部的词元位置或功能级别上测试专业化。我们的结果表明,电路之间的结构差异并不足以证明不同机制,并且揭示这一点需要边​​缘级评估和跨条件转移测试。