论文
赋值与加法:组合算术的机制研究
Assign and Add: A Mechanistic Study of Compositional Arithmetic
摘要
大语言模型 能够组合技能来执行复杂的任务,其中许多任务在训练期间可能没有见过。这种组合究竟是如何发生的细节仍然难以捉摸。在本文中,我们通过考虑涉及变量分配和模加法的简单受控设置来研究 Transformer 中的组合泛化机制。通过将训练数据划分为不相交的集合,我们观察到小型 Transformer 能够泛化到以前未见过的变量和数字的组合。我们的机制分析表明,无论输入是直接给出还是通过单独的变量分配机制间接给出,都使用相同的“模加法”MLP 模块。我们还从经验角度分析了训练动态,揭示了学习的三个阶段:首先学习模加法,然后学习变量分配所需的结构,最后是模型推广到训练中未见的一些硬序列的细化阶段。最后,我们提供了一个理论框架来解释组合性如何从训练动态中产生。这些结果表明,组合泛化可能是~Transformer 中内部机制组合性的自然结果。