论文
第一词元广播者:Transformer 中语言身份和分布式鲁棒性的机制起源
First-Token Broadcasters: Mechanistic Origins of Language Identity and Distributed Robustness in Transformers
摘要
为什么多语言模型有时会生成错误的语言,以及为什么这个问题如此难以修复?我们引入了语言身份头消融 (LIHA),这是一种因果干预措施,可将每个注意力头单独归零,并在涵盖七种语言的 2,700 个提示语言对的并行数据集中测量由此产生的语言切换率。应用于 GPT-2,LIHA 识别出一小组第一词元广播者头 - 由 L6H1 领导(切换率 0.32,高于总体平均值 3.23 $σ$) - 持续关注第一提示词元,在整个生成过程中传播其语言信号。头部被消融时的补偿性重新分配具有统计显着性(p < $10^{-5}$),并且遵循定向、分层模式:补偿总是在被消融的头部上方的层中招募头部,这表明前馈级联而不是全局扩散。为了探究训练制度如何塑造这些电路,我们将 LIHA 应用于受控对 - Qwen2.5-1.5B-Base 和 Qwen2.5-1.5B-Instruct - 架构和大小相同,仅训练方面不同。基础模型几乎是平坦的(最大 SR=0.016,SR=0.0 时为 200/336 个头);指令模型将因果影响急剧集中在第 0 层,以 L0H5(SR=0.224,高于平均值 8.93 $σ$)为首,所有其他层都接近于零。这种受控比较提供了直接的因果证据,表明指令调整将语言识别电路重新组织到早期层本地化。对中文和俄语的扩展实验证实,第一个词元广播在 GPT-2 中是特定于脚本的,非拉丁语言在第 0 层处理——与指令调整模型相同的位置。代码和数据将在发布后发布。