论文

叠加错觉?语言模型中潜在思维的原理分析

The Illusion of Superposition? A Principled Analysis of Latent Thinking in Language Models

模型评测模型行为与机制分析

摘要

通过连续思想链进行的潜在推理(潜在 CoT)已成为离散 CoT 推理的有前途的替代方案。在连续空间中操作可以提高表现力,并被假设可以实现叠加:在单个表示中同时维护多个候选解决方案的能力。尽管存在理论上的争论,但目前尚不清楚语言模型在使用潜在 CoT 进行推理时是否真正利用了叠加。我们通过三种机制来研究这个问题:无需训练 机制将潜在思想构建为词元嵌入的凸组合;微调机制,其中基础模型适合产生潜在思想;以及从头开始的机制,其中模型完全使用潜在思想进行训练来解决给定任务。使用 logits Lens 和实体级探测来分析内部表示,我们发现只有从头开始训练的模型才表现出使用叠加的迹象。在 无需训练 和微调机制中,我们发现叠加要么崩溃,要么根本不使用,而是模型发现了捷径解决方案。我们认为这是由于两个互补的现象造成的:i)自然语言数据的预训练会使模型在最后一层中使用词元;ii)容量对模型偏爱的解决方案有巨大影响。总之,我们的结果为连续思维链推理中叠加何时以及为何出现提供了统一的解释,并确定了叠加崩溃的条件。