论文
潜在思维流:大语言模型中的高效潜在推理
Latent Thought Flow: Efficient Latent Reasoning in Large Language Models
摘要
大语言模型(LLM)日益依赖中间推理——但显式思维链(CoT) suffer 语言空间瓶颈:每个思想必须解码为token——造成高推理开销。潜在推理把深思移入连续空间——但既有方法大多学习确定性或奖励最大化路径——缺乏在不同正确性与成本的轨迹间按原则分配概率的方法。我们提出潜在思维流(LTF)——把推理建模为变长连续轨迹——并训练采样器匹配由奖励诱导的、关于答案质量与计算成本的后验。我们以使用随机潜在转移的连续GFlowNet实例化。为处理稀疏答案监督——我们引入熵加权子轨迹平衡目标提供中间奖励——以及锚定探索的参照先验正则化。微调与迁移学习设定下的实验表明LTF超越显式CoT与潜在推理基线——较强潜在推理基线平均提升准确率9.5%、缩短推理长度27.2%。
