论文

Tyler:语言模型的类型化潜在推理——何时思考、计算什么以及分配多少

Tyler: Typed Latent Reasoning for Language Models -- When to Think, What to Compute, and How Much to Allocate

模型推理推理策略与问题分解

摘要

思想链 (CoT) 提示通过将中间计算外部化为离散文本标记来改​​进 大语言模型 (LLM) 中的推理,但此文本接口也引入了冗余和推理开销。潜在推理通过以连续表示形式进行部分计算提供了一种有前途的替代方案。然而,现有方法通常预先定义何时调用潜在计算以及在解码期间如何分配潜在计算,从而留下了一个未解决的关键问题:何时调用潜在计算、执行什么类型的计算以及分配多少预算。我们提出 \textbf{Ty}ped \textbf{L}at\textbf{e}nt \textbf{R}easoning (Tyler),这是一种用于自回归解码期间潜在推理的类型化和预算感知框架。泰勒学习了一种策略,在每个解码步骤中,在发出文本标记和切换到专门用于特定推理功能的潜在计算模块之间进行选择。一旦被调用,操作符就会将当前的推理状态映射到支持全局规划、本地状态更新或可重用的过程抽象的潜在标记中。在三个主干 LLM 上进行的广泛实验中,Tyler 比 CoT 提高了高达 14.49 点的准确度,比最强的竞争基线提高了 4.30 点。它进一步泛化了不同的推理领域,并以最低的遗忘实现了最佳的最终阶段性能。