论文
WIDER:缓解隐式思维链推理的潜在秩坍塌
Think Wider: Mitigating Latent Rank Collapse in Implicit Chain-of-Thought Reasoning
摘要
思维链 (CoT) 推理通过引入中间计算提高了 大语言模型 的推理能力,但显式推理解释会增加解码长度、延迟和上下文成本。隐式 CoT 通过将中间推理转移到连续潜在状态来提供更有效的替代方案。然而,潜在推理可能不稳定:连续的潜在状态可能变得过于相似并朝着共同的主导方向崩溃,从而减少了推理轨迹的多样性。在这项工作中,我们识别了 $\textit{潜在秩坍塌}$ 并提出了 $\textbf{WIDER}$,一个用于隐式 CoT 的轻量级谱正则化器。在训练期间,WIDER 估计每个潜在轨迹的共享方向,并惩罚对该方向的投影,鼓励潜在状态跨越更广泛的表征子空间。该方法是即插即用的,并且保持主干模型、潜在调度和推理时间解码过程不变。我们进一步将这种崩溃表述为隐式推理中的几何瓶颈,将其缓解措施视为训练时正则化问题,而不是推理时解码变化。大量实验表明,WIDER 改善了匹配的隐式 CoT 基线,而机制分析揭示了更高的有效秩、更低的主导方向能量以及减少了潜在步骤之间的冗余。这些结果强调了潜在子空间利用率是高效连续推理的一个重要因素,为分析和改进隐式 CoT 提供了几何视角。代码可在 https://github.com/whitesweater/WIDER 获取。