论文

模式选择性不是任务因果结构:1B 类语言模型中组合任务电路的跨架构机制研究

Pattern Selectivity is Not Task-Causal Structure: A Cross-Architecture Mechanistic Study of Composed-Task Circuits in 1B-Class Language Models

模型评测模型行为与机制分析

摘要

我们测试单一的筛选和消融方法(通过任务模式选择性识别注意头回路,然后通过针对匹配随机空值的因果消融进行验证)是否在模型系列中产生一致的机械主张。配方跨管道移植;它所识别的具体电路则不然。在四个组合任务(间接对象识别、大于、后继序列、变量绑定)和来自不同训练管道的三个 1B 类语言模型(Pythia 1B/Pile/dense;OLMo 1B/DCLM/dense;OLMoE 1B-7B/DCLM/专家混合)中,我们运行一个统一的协议,其中在每个单元的十个种子中采样匹配的随机空值。由此产生的 12 个(任务、模型)单元不包含任何两个在可比较的效应大小下共享相同的主要因果屏幕的单元:具有相同行为能力的相同任务是通过跨模型的不同注意模式类型来实现的。我们引入了五类筛选结果分类法——主要原因、次要原因、相关、干扰、无效——以及定量阈值,并显示所有五种结果都出现在面板中。我们提出了一个可证伪的假设:我们面板中的 MoE 模型在基础的先前词元位置基底之上构建了组合任务电路(先前词元电路消融是 OLMoE 1B-7B 4 个任务中的 3 个任务中最强的因果屏幕),IOI 例外与 IOI 一致,是一个最终位置名称复制任务,其结构直接探测不同的模式。该假设附带了对其他 MoE 语言模型的明确预测。我们诚实地构建了该方法:来自配套方法论论文的光谱参与比信号是专业计算的一般指标;使发现任务特定的是任务模式屏幕加上每个模型的因果验证。