论文

潜在思维流:大语言模型中的高效潜在推理

Latent Thought Flow: Efficient Latent Reasoning in Large Language Models

模型架构新型架构

摘要

大语言模型(LLM)日益依赖中间推理——但显式思维链(CoT) suffer 语言空间瓶颈:每个思想必须解码为token——造成高推理开销。潜在推理把深思移入连续空间——但既有方法大多学习确定性或奖励最大化路径——缺乏在不同正确性与成本的轨迹间按原则分配概率的方法。我们提出潜在思维流(LTF)——把推理建模为变长连续轨迹——并训练采样器匹配由奖励诱导的、关于答案质量与计算成本的后验。我们以使用随机潜在转移的连续GFlowNet实例化。为处理稀疏答案监督——我们引入熵加权子轨迹平衡目标提供中间奖励——以及锚定探索的参照先验正则化。微调与迁移学习设定下的实验表明LTF超越显式CoT与潜在推理基线——较强潜在推理基线平均提升准确率9.5%、缩短推理长度27.2%。

潜在思维流:大语言模型中的高效潜在推理:论文配图
图 1:我们的 LTF 框架图示。左:LTF 的整体架构。只有 LoRA 模块和潜在推理头是可训练的。右图:从连续 GFlowNet 角度概述潜在思维轨迹。潜在推理轨迹表示为 τ=(s0,𝐳1,…,𝐳T,⊥)\tau=(s_{0},\mathbf{z}_{1},\ldots,\mathbf{z}_{T},\bot),其中𝐳t\mathbf{z}_{t} 表示步骤 tt 处的潜在思维状态。前向策略 PFP_{F} 通过具有潜在头的 LLM 参数化为变分采样(方程(3)),并使用我们的熵加权子轨迹平衡目标(方程(18))进行训练,以实现流量平衡条件。