论文

注意回路何时形成?三种 1B 级架构的能力发展轨迹和注意力集中出现

When Do Attention Circuits Form? Developmental Trajectories of Capability and Attention-Sink Emergence Across Three 1B-ClassArchitectures

模型评测模型行为与机制分析

摘要

我们跟踪了跨越两个架构系列(密集 Transformer、混合专家)和两个预训练语料库(The Pile、DCLM)的三个 1B 级语言模型的注意力头回路形成的发展轨迹:Pythia 1B、OLMo 1B-0724-hf 和 OLMoE 1B-7B-0924。在每个模型 10 个对数间隔修订中的每一个(总共 30 个机械可解释性运行)中,我们应用参与比 (PR) 频谱信号和全头能力特定选择性屏幕来跟踪感应头、先前词元和 BOS 吸引子头的出现。五项发现。 (F1) 第 0 层和第 1 层在每个模型的每次修订中都会产生零 BOS 分类头:L0/L1 零 BOS 层是一种架构属性,而不是学习结果。 (F2) 整个模型 BOS 吸引子分数遵循三种不同的出现形状 - Pythia 1B 中的逐渐斜坡、OLMo 1B 中的急剧相变(相邻检查点之间为 7% 到 70%)以及 OLMoE 1B-7B 中的逐渐斜坡。 (F3) 在 DCLM 模型中,感应电路的形成比 BOS 吸引子形成早 10-20 倍(以词元计算);能力回路的形成和注意力池的形成是两种转变,而不是一种转变。 (F4) 特定于能力的屏幕在总训练标记的 0.3-2% 内收敛到最终感应电路——电路识别不需要最终模型。 (F5) 对于所有三个模型中采样的每个最终检查点感应头,每个头的 PR 在该头跨越其能力选择性阈值的第一次修订时或之前升高。结果改进了归纳相变框架:在 DCLM 上训练的 1B 类模型中,归纳转变和注意力池转变在标记中按一个数量级分开,并且具有性质不同的形状。