论文
电路能告诉我们多少信息?测量语言模型电路的一致性和特异性
How Much Do Circuits Tell Us? Measuring the Consistency and Specificity of Language Model Circuits
摘要
机械可解释性中的电路框架旨在识别模型组件的稀疏子图,这些子图对行为负有因果责任,通常通过测量必要性和充分性来评估。但这些标准很少说明电路是否始终如一地捕获模型如何执行任务,或者它是否特定于该任务。我们在六个任务和五个模型中研究这两个属性,即一致性和特异性,在组件级别(注意力头和 MLP 块)和单个 MLP 神经元级别提取电路。我们发现组件级电路在大多数任务中高度一致且因果关系重要,但它们并不具体:消融一个任务的电路对另一个任务的性能的损害与该任务自己的电路造成的损害一样多。另一方面,神经元级电路表现出更高的任务特异性,但任务内的一致性却差得多。这是通过电路重叠来解释的:组件级电路在所有任务对(相关或不相关)中共享大部分组件,而神经元级电路仅在密切相关的任务之间重叠。在对 Llama-3.2-3B 任务电路共享组件的案例研究中,我们表明它们主要由 MLP 块组成,而其中的少数注意力头却是通用的注意力池头。总的来说,我们的研究结果提出了关于电路在多大程度上可以支持对模型行为的有针对性的理解和干预的问题。