论文
SuperThoughts:叠加推理标记
SuperThoughts: Reasoning Tokens in Superposition
摘要
长思想链 (CoT) 推理改进了 LLM 问题解决能力,但由于顺序词元生成,计算成本较高。虽然最近的工作探索了连续潜在空间中的推理以绕过离散词元生成,但它们经常在训练稳定性方面遇到困难,并且由于缺乏监督信号而无法扩展到复杂的长期任务。我们提出了 SuperThoughts,它将连续的 CoT 词元对压缩为单个潜在表示,并通过轻量级多词元预测(MTP)模块每一步解码两个词元。这保留了训练时的离散词元监督,同时使推理时的吞吐量加倍。我们对 Qwen2.5-Math-1.5B-Instruct、Qwen2.5-Math-7B-Instruct、Qwen2.5-Math-14B-Instruct 进行微调,并在 MATH500、AMC、OlympiadBench 和 GPQA-Diamond 上进行评估。凭借基于置信度的自适应机制(在不确定时回退到标准解码),SuperThoughts 实现了 $\sim$20--30\% CoT 长度减少,同时保持精度且降幅最小(大多数任务的精度下降 1-2 个点)。