论文

MechaTerp-TRACE:语言模型中组件消融分析的新方法

MechaTerp-TRACE: A Novel Approach for Component Ablation Analysis in Language Models

模型评测模型行为与机制分析

摘要

对大型语言模型的可解释性研究已经产生了前馈层中的事实回忆和自注意力中的标记关系的说明,但很少有工作提供统一的方法来比较不同架构组件对模型输出的因果贡献。我们引入了 MechaTerp(机械可解释性套件)-TRACE(教师强制消融组件效应注册的子集),这是一种架构和研究,用于测量语言模型的每个注册组件对命名实体的生成的支持程度。 TRACE 一次消融一个组件,并测量固定答案标记处输出分布的变化,因此可以在通用范围内比较从整个Transformer块到单个神经元和输出logits的组件类型。我们将其应用于 13 个指令调整的密集解码器模型,涵盖 5 个系列和 1 到 300 亿个参数,消除了 48 个医学提示和 42 个一般知识提示中的 49,656 个组件。我们发现,无论提示询问哪个实体,在每个模型中承载最大效果的组件都是相同的少数、位置固定的组件,并且一旦删除这些组件,剩余的支持几乎均匀分布在 13 个模型中的 11 个模型中。因此,实体知识的明显本地化很大程度上归因于通用生成机制,这对假设实体知识位于可找到位置的方法(包括有针对性的知识编辑)有直接影响。