论文
数据驱动的语言模型可解释性回路发现
Data-driven Circuit Discovery for Interpretability of Language Models
摘要
电路发现旨在解释语言模型 (LM) 如何通过本地化和解释电路(负责 LM 行为的计算子图)来实现特定任务。现有的电路发现方法是假设驱动的;他们首先使用数据集非正式地定义任务,然后对该数据集应用电路发现算法以获得单个电路。这提出了两个强有力的假设:LM 使用单个电路实现任务,并且数据集充分代表了人类理解的任务。我们在之前研究的四个任务中系统地测试了这些假设,发现即使保留任务语义的微小数据集变化也可以产生具有低边缘重叠和跨数据集忠实度的电路。更引人注目的是,当应用于具有两个不同任务的混合数据集(其单独发现的电路具有接近零的交叉忠实度)时,现有方法仍然返回在两个任务中具有高忠实度的单个电路。这表明当前的方法发现了数据集特定的电路,而不是一般的任务电路。我们提出了数据驱动电路发现(DCD),这是一种新的发现框架,它放弃了这两个假设:DCD 不是返回数据集的单个电路,而是首先根据模型处理示例的相似程度对数据集中的示例进行聚类,并为每个组发现单独的电路。这使得不同的机制可以单独出现,而不是合并到一个电路中;每个电路解释其组,而不是完整的任务。实验表明,DCD 在每个数据集中发现了多个电路,每个电路比现有方法发现的单个电路更忠实于其组。从广义上讲,DCD 让数据揭示 LM 内的机械结构,而不是依赖于人类定义的任务边界,这些边界可能与模型组织计算的方式不一致。
