论文

消息传递实现高效推理

Message Passing Enables Efficient Reasoning

模型推理测试时计算扩展

摘要

虽然推理时间缩放提高了 大语言模型 (LLM) 的推理能力,但生成长思维链 (CoT) 的需求是一个计算瓶颈。因此,与 CoT 等顺序扩展方法相比,最近的并行扩展技术改为使用 fork 和 join (FJ) 原语在多个 LLM 线程之间划分工作。然而,在 fork-join 范例中,线程通常是瞬态的,并且彼此之间不进行逐点通信,这限制了可伸缩性。为了解决这个问题,我们引入了消息传递语言模型 (MPLM),这是一种用于 LLM 推理的框架,其中线程通过轻量级发送和接收原语直接进行通信。 MPLM 通过两个关键机制实现高效扩展:(1) 通过避免冗余上下文共享来降低通信成本,以及 (2) 抢占,允许线程根据来自其对等方的部分信息提前终止。我们展示了 MPLM 在 3 类任务上的前景。首先,在数独谜题中,我们表明 MPLM 需要比串行 CoT 和并行 FJ 渐近更小的上下文。然后,我们对单个模型进行微调,以解决 25 x 25 的难题,这些难题对于标准 CoT 和 FJ 方法以及无需工具的前沿推理模型来说仍然具有挑战性。其次,在 3-SAT 难题上,抢占能力允许终止无希望的分支,从而提高效率。最后,我们表明,适当提示的大型预训练模型遵循 MPLM 协议,在长上下文问答方面取得了相对于流行的 fork-join 方法有竞争力的结果。