论文

无头多思想的模型

A Model with No Head and Many Thoughts

模型推理推理策略与问题分解

摘要

大语言模型 通过在每一步通过大词汇头投射隐藏状态来进行解码。此操作的计算成本很高,并且迫使所有推理都以离散标记来表达。我们引入了 Soft Latent Thinking,这是一种在推理过程中用轻型投影仪取代 LM 头的方法,从而能够在嵌入空间中进行自回归,其中推理步骤保持连续而不是标记化。 DeepSeek-Qwen-1.5B 和 LLaMA-3.2-3B 上的实验表明,Soft Latent Thinking 持续改进了所有 k 中的 pass@k,同时减少了思想链期间每步的计算。我们的方法在所有软思维方法中达到了最高的 pass@32,证明可以在连续空间中进行有效推理,而无需生成离散标记。