论文
语言模型潜在轨迹中的不变推理方向
Invariant Reasoning Directions in Latent Trajectories of Language Models
摘要
潜在推理模型直接在隐藏状态空间中执行多步推理,但这些潜在推理轨迹的结构仍然知之甚少。我们表明,较强和较弱推理轨迹之间的对比细化信号表现出高度集中的低秩结构,而不受约束的潜在更新仍然对释义、检查点选择和轨迹扰动敏感。这些观察结果表明,潜在推理轨迹包含稳定的不变方向和不稳定的特定于实例的变化。我们引入了 \textbf{Trajectory-Invariant Latent Refinement (TILR)},这是一个 无需训练 干预框架,用于识别和操纵潜在空间中的稳定推理方向。 TILR 首先从输入之间的对比轨迹差异中学习低秩不变子空间,然后限制对该子空间的潜在干预,同时通过自适应对齐门抑制对齐不良的更新。在六个推理基准中,我们发现少数潜在方向解释了强推理轨迹和弱推理轨迹之间的大部分变化。对这些方向的干预可以提高推理的一致性并减少释义和扰动下的轨迹不稳定性。 TILR 将释义下的答案一致性提高了约 10%,并将潜在轨迹方差减少了高达 $50\%$,同时保持推理准确性。这些结果支持潜在推理的几何观点,其中可转移推理行为从隐藏状态轨迹内的稳定低维结构中出现。