论文
Transformer 在归纳推理任务中的不变学习动态
Invariant Learning Dynamics of Transformers in Inductive Reasoning Tasks
摘要
我们提出了一个理论框架来解释 Transformer 语言模型中归纳推理能力的出现。虽然迄今为止关于 Transformer 学习动态的工作大多与特定任务相关,但我们研究了一类归纳任务,它统一了文献中已知的几个合成任务,包括上下文 n 元语法和多跳推理。在本课程中,我们从理论上证明注意力模型的训练动态可以局限于高度可解释的低维不变流形。在这个流形上,学习动态是由少数可解释的坐标而不是数百万个参数捕获的,这使得理论和实证分析都更容易处理。使用这个框架,我们描述了数据统计如何控制上下文学习和权重学习之间的竞争,我们研究了当可能有多个解决方案时随机初始化如何确定“获胜”电路,并且我们证明与流形相关的坐标系可用于自动检测在训练模型中学习了哪些电路。通过将电路形成视为一种低维动态现象,我们向 Transformer 如何学习的预测理论迈出了一步。