论文

后期:通过潜在探索和显式验证进行有效的测试时推理

LaTER: Efficient Test-Time Reasoning via Latent Exploration and Explicit Verification

模型推理推理策略与问题分解

摘要

思想链 (CoT) 推理改进了 大语言模型 (LLM) 处理困难任务的能力,但它也使推理变得昂贵,因为每个中间步骤都必须生成为离散标记。潜在推理通过传播连续状态来减少可见标记的生成,但用潜在计算替换显式推导可能会损害需要符号检查的任务。我们提出了先隐式推理(LaTER),这是一种两阶段范式,首先在连续的潜在空间中执行有界探索,然后切换到显式 CoT 进行验证和答案生成。在 无需训练 实例化中,LaTER 将最终层隐藏状态投影回输入嵌入空间,保留潜在的 KV 缓存,并使用熵和模型原生停止词元探测来决定何时切换。我们发现强推理模型已经在该接口下表现出结构化的潜在轨迹。在 Qwen3-14B 上,无需训练 LaTER 在多个基准上将总词元使用量减少了 16%-32%,同时匹配或提高了大多数基准的准确性;例如,它将 AIME 2025 从 70.0% 提高到 73.3%,同时将词元从 15,730 个减少到 10,661 个。我们进一步构建了 Latent-Switch-69K,这是一个监督语料库,它将精简的解决方案直觉与缩短的显式推导配对。 微调 具有潜在采样轨迹和停止监督功能,可带来额外收益:训练后的 LaTER 在 AIME 2025 上达到 80.0% 的准确率,比标准 CoT 基线高出 10.0 个点,同时使用的词元减少了 33%。我们的代码、数据和模型可在 https://github.com/TioeAre/LaTER 获取。