论文

几何潜在推理在 LLM 中导致更短的代数

Geometric Latent Reasoning Induces Shorter Generations in LLMs

模型推理推理策略与问题分解

摘要

大语言模型 通过生成长长的显式推理标记链来解决复杂问题。虽然有效,但这使得推理成本高昂、对长度敏感并且受限于(离散)自然语言。虽然潜在推理提供了一种连续的替代方案,但确定中间潜在状态的有用结构是一个公开的挑战。在本文中,我们将潜在推理表述为模型预训练标记嵌入空间内的几何路径近似问题。我们引入几何潜在推理(GLR),它使用轻量级转换头来预测嵌入空间中的迭代方向更新。使用文本思想链痕迹作为锚点,GLR 学习近似离散推理轨迹,同时允许与精确标记嵌入的连续偏差。使用 Qwen3 模型对数学推理基准的评估揭示了一个新现象:几何潜在推理在没有明确长度目标的情况下导致显着缩短的世代。通过用连续的潜在步骤取代早期的显式推理,模型通常可以使用更少的总生成步骤得出正确的答案。这些发现表明,连续轨迹充当紧凑的中间推理状态,揭示了潜在计算预算、输出长度和准确性之间的新权衡。