论文

解锁 大语言模型 的工作记忆以进行潜在推理

Unlocking the Working Memory of Large Language Models for Latent Reasoning

模型推理推理策略与问题分解

摘要

为了提高 大语言模型 的推理能力,通常通过在最终答案之前生成中间标记来扩展测试时计算。然而,这将推理与自回归生成结合起来,从而将内部计算与外部通信混为一谈。相比之下,人类认知可以利用工作记忆在内部保存和操纵信息,而不需要将中间思想外化。借鉴这一原理,我们引入了内存推理(RiM),这是一种潜在的推理方法,用内存块代替推理步骤的自回归生成。这些内存块是特殊词元的固定序列,可解锁 大语言模型 的工作内存容量。由于它们是固定的而不是生成的,因此可以在单个前向传递中处理它们,从而实现计算高效的潜在推理。为了操作这些记忆块,我们采用了两阶段课程。首先,我们通过预测每个内存块之后的显式推理步骤来为它们奠定基础。其次,我们放弃这种步骤级监督,并在每个内存块之后迭代地细化最终答案。我们的推理基准实验表明,在不同家族和规模的语言模型中,RiM 匹配或超过了现有的潜在推理方法,同时避免了思想的自回归生成。这些结果表明,大语言模型 可以被训练为使用工作记忆作为潜在推理的有效机制。