论文

当潜在推理转向失败时:潜在到语言的过渡差距

When Steering Fails in Latent Reasoning: A Latent-to-Language Transition Gap

模型评测模型行为与机制分析

摘要

激活引导已成为在显式思维链 (CoT) 推理过程中控制语言模型的广泛使用的方法,推动其扩展到潜在 CoT。然而,我们发现,即使隐藏表示移动了相当的量,控制连续思维对后续语言生成的影响也比控制显式 CoT 弱得多。我们首先证明任务信息在连续的思维中仍然是可识别的。因此,我们假设存在一个\textbf{潜在到语言的转换差距},其中潜在空间的干预效应无法转移到语言生成。进一步的两个结果支持这一假设:输出分布在转换边界处突然变化,并且与任务相关的方向在潜在 CoT 中施加的双向控制比在显式 CoT 中弱得多。这些发现将过渡接口确定为评估和设计未来潜在转向方法的中心目标。