论文

循环、思考和概括:循环深度的内隐推理 Transformer

Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers

模型架构递归架构

摘要

我们研究隐式推理,即在单个前向传递中组合知识或规则的能力。虽然基于 Transformer 的 大语言模型 存储了大量事实知识和规则,但它们通常无法为隐式多跳推理组合这些知识,这表明其参数知识缺乏组合概括。为了解决这个限制,我们研究了循环深度 Transformer,它可以在相同的 Transformer 层上进行迭代计算。我们研究了隐式推理场景下的两个组合泛化挑战:系统泛化,即结合训练期间从未用于组合的知识,以及深度外推,即从有限的推理深度(例如最多 5 跳的训练)泛化到更深的组合(例如 10 跳)。通过对从头开始训练的模型进行对照研究,我们表明,虽然普通 Transformer 难以应对泛化挑战,但循环深度 Transformer 可以有效地进行这种泛化。对于系统泛化,我们发现这种能力是通过三个阶段的摸索过程产生的,从记忆到分布内泛化,最后到机械分析支持的系统泛化。对于深度外推,我们表明可以通过缩放推理时间递归来解锁超出训练深度的泛化,更多迭代可以实现更深入的推理。我们进一步研究训练策略如何影响外推,为训练循环深度 Transformer 提供指导,并确定一个关键限制,即过度思考,过度循环会降低预测并限制对非常深的组合的泛化。