论文
双向归纳:掩蔽扩散语言模型中情境学习的机制分析
Induction in Both Directions: A Mechanistic Analysis of In-Context Learning in Masked Diffusion Language Models
摘要
虽然自回归 (AR) Transformer 的内部机制已被广泛研究,但对于扩散语言模型 (DLM)(一种通过迭代去噪生成文本的新兴替代方案)知之甚少。在这项工作中,我们研究了 DLM 如何实现归纳,这是一种上下文学习背后的机制,其中模型找到重复的上下文并复制其后面的标记。我们的分析将仅注意 AR 模型和吸收掩模 DLM 与匹配的架构进行了比较。我们发现 DLM 学习双向归纳电路,其中前一个词元和下一个词元头将本地上下文写入残差流,随后的归纳头使用它从匹配的源位置查找并复制答案。该电路是方向对称的,无论源出现在过去还是未来,它都可以工作。当只有左侧上下文可见时,与 AR 模型所看到的内容相匹配,DLM 在归纳能力方面并不优于 AR 对应物。然而,我们观察到,当屏蔽标记的两侧都可见时,它具有更强的归纳性,表明双向上下文访问而不是更强的单侧机制。除了归纳之外,我们还提供了因果证据,表明 DLM 计算屏蔽标记的全局部分并将其用作隐式时间步,即使它们没有给出显式时间步嵌入。