论文

潜在CoT模型是逐步思考的吗?面向顺序推理任务的机制研究

Do Latent-CoT Models Think Step-by-Step? A Mechanistic Study on Sequential Reasoning Tasks

模型评测模型行为与机制分析

摘要

潜在思维链(Latent-CoT)旨在实现逐步计算而无需输出冗长推理文本,但其机制仍不清楚。我们在严格的顺序多项式迭代任务上研究CODI——一个连续思维师生蒸馏模型。使用logit-lens解码、线性探针、注意力分析与激活修补,我们定位中间状态表示并追踪其到最终读出的路由。在两跳与三跳任务上,CODI形成完整的桥接状态集合,这些状态在潜在思维位置间逐渐可解码,而最终输入则走一条独立的近直接通路;预测经由思维结束边界的晚期融合产生。对于更长的跳数,CODI并不能可靠地执行完整的潜在推演,而是表现出部分潜在推理路径:集中于晚期中间量,并在答案读出位置将其与最后输入融合。消融显示,这一部分通路在包括更难优化的状态变化下可能崩溃。总体而言,我们划清了CODI式潜在CoT何时产生忠实迭代计算、何时退化为压缩或捷径策略的界限,并凸显为顺序推理设计稳健潜在CoT目标的挑战。

潜在CoT模型是逐步思考的吗?面向顺序推理任务的机制研究
图1:CODI 在序列推理任务上的机制研究。上:用于我们多项式迭代任务的 CODI 训练设置。下:我们用于分析学生模型内部计算的四种机制可解释性方法。