论文
LLoCoT:用循环Transformer并行细化潜在推理状态
From Chain-of-Thought to Loops: Non-Autoregressive Latent Reasoning via Looped Transformers
摘要
思维链 (CoT) 推理通常通过在回答之前为模型提供额外的计算来提高语言模型的性能。然而,显式 CoT 将此计算表示为一系列自回归生成的标记。潜在推理用紧凑的连续状态替换了这些标记,但大多数自回归潜在推理方法保留了潜在向量之间从左到右的依赖关系。我们介绍了 LLoCoT:一个循环的潜在推理框架,它用紧凑的潜在工作空间的迭代细化取代了从左到右的潜在生成。共享Transformer被重新应用于少量的细化迭代,根据提示和不断变化的工作空间状态联合更新潜在槽。使用精炼状态,概率头预测一个分布,从中并行采样潜在标记并用于调节自回归解码器以生成答案。训练使用从显式 CoT 导出的连续表示以及最终答案预测损失和基于可能性的潜在状态监督。 在 HumanEval 和 MBPP 中,LLoCoT 在评估方法中实现了最高平均值,其准确度与 Reasoning SFT(我们的显式 CoT 基线)相当,同时优于基本模型、仅答案 SFT 和 NF-CoT。相对于 Reasoning SFT,LLoCoT 将第一个答案标记的时间减少了大约 $36\times$,将推理阶段延迟减少了大约 $42\times$,同时将端到端吞吐量增加了 $9.2\%$。该设计用并行潜在槽细化取代了串行思维生成,同时保留了概率潜在建模和自回归答案解码。