论文
先复制、后抑制:语言模型训练中低于随机水平的暂态下降
Copying Before Suppression: What Drives a Below-Chance Dip During Language Model Training?
摘要
机械可解释性通常研究经过充分训练的模型,但是当模型仍在学习任务时,驱动行为的计算可能会发生变化。在间接对象识别任务中,模型应继续使用提到过一次的名称,而不是提到两次的名称。 Pythia 模型通过早期的训练窗口,在该窗口中它们更喜欢重复的名称,因此两个名称之间的选择准确性低于一半,而固定文本样本上的语言模型损失在同一窗口中不断减少。该窗口反映了两次计算之间的暂时不平衡。我们通过选择一组写下重复名称的注意力头来确定错误偏好的一个原因,在与用于因果评估的提示分开的提示上,保持该选择固定,然后用一组单独的非重复名称提示上的平均输出替换每个头的最终 token 输出。这改善了单独训练的 160M 模型以及官方 160M、410M 和 1B 模型中的正确减去重复 logit 差异。在160M处,在成熟模型中降低重复名称的头部此时几乎没有显示出其成熟行为。它将不到百分之一的注意力集中在重复提及上,并且其输出几乎没有对降低该名称的 logit 做出直接贡献。这两种属性都会随着行为恢复的时间间隔而增长。在 160M、410M 和 1B 模型中,将相应头部的成熟参数移植到早期的 检查点 中,可恢复训练末期所见的正确减去重复 logit 差异的总体改进的 35% 至 68%。相关的早期到晚期逆转出现在进一步的 Pythia 尺度、两个独立训练的 GPT-2 模型和 OLMo 中。因此,成熟的电路可以隐藏在训练中早期塑造行为的瞬态因果配置。