论文

机械可解释性的示例分区

Exemplar Partitioning for Mechanistic Interpretability

模型评测模型行为与机制分析

摘要

我们引入了 Exemplar Partitioning (EP),这是一种从 大语言模型 激活构建可解释特征字典的无监督方法。 EP 字典是激活空间的 Voronoi 分区,由距离阈值内的领导者聚类流激活构建。每个区域都由观察到的样本及其成员激活的平均值来定义,这定义了区域成员资格并提供了干预方向。字典大小由选定阈值的激活流决定,而不是预先选择。示例将区域与观察到的输入联系起来,允许从同一输入流构建的字典在层、训练检查点和架构之间进行比较。我们演示了如何使用 EP 来解释和干预模型行为、通过训练跟踪激活空间的变化以及检测隐藏的概念。比较基础和指令调整的 Gemma-2-2B 和 Llama-3.1-8B 上的 EP 字典表明,指令调整在两个模型中以类似的方式重新组织有害的提示激活,但粒度不同。对这些区域的干预使这两种模型都回答了它们之前拒绝的有害请求。在经过训练来隐藏秘密单词的 21 个 Taboo 模型中的 19 个中,EP 发现了基本模型中不存在的新区域,其解码的标记与检查时已知的秘密相关。尽管 EP 将每个标记分配给单个区域,但从 EP 区域构建的线性探针可实现高达 $90.5\%$ 的完全激活探针精度。在 Gemma-2-2B-it 第 20 层的 AxBench 概念检测中,EP 实现了所有无监督方法中最高的平均 AUROC(0.937 美元),优于 SAE-A(0.911 美元)并接近监督探针(0.946 美元)。构建 EP 字典既快速又便宜:EP 使用的构建词元比同类 SAE 少 10^3$ 倍。