论文

循环推理语言模型的机制分析

A Mechanistic Analysis of Looped Reasoning Language Models

模型评测模型行为与机制分析

摘要

推理已成为 大语言模型 的核心能力。最近的研究表明,可以通过在潜在维度中循环 LLM 层来提高推理性能,从而产生循环推理语言模型。尽管结果很有希望,但很少有研究研究它们的内部动力学与标准前馈模型的内部动力学有何不同。在本文中,我们对循环语言模型中的潜在状​​态进行了机械分析,特别关注前馈模型中观察到的推理阶段与循环模型中观察到的推理阶段的比较。为此,我们分析了循环递归,并表明对于许多研究的模型来说,循环中的每一层都会收敛到一个不同的固定点;因此,循环块在潜在空间中遵循一致的循环轨迹。我们提供的证据表明,当达到这些固定点时,注意力头行为就会稳定下来,从而导致重复出现的行为保持不变。根据经验,我们发现循环块学习的推理阶段与前馈模型的推理阶段密切相关,并在每次迭代中深度重复这些阶段。我们研究循环块大小、输入注入和归一化如何影响这些循环不动点的出现和稳定性。我们相信这些发现有助于将机械见解转化为建筑设计的实际指导。