论文

推理错误在 LLM 的剩余流轨迹中具有区域和方向

Reasoning Errors Have a Region and a Direction in the Residual-Stream Trajectory of LLMs

模型推理推理验证与自校正

摘要

随着语言模型越来越多地用于需要可验证推理的任务,可靠地区分正确的推理和有缺陷的推理已成为一个重要的实际问题。最近基于轨迹的方法在分层残余流位移中寻找该信号,捕获表示如何变化,同时衰减一些稳定的、特定于词元的信息。然而,位移忽略了更新所源自的状态,而恢复完整状态则存在重新引入容易走捷径的信息的风险。我们确定了这种权衡,并提出了一种三流检测器,将运动与两个受限的位置视图相结合。基于矢量量化的粗略区域读取器和基于归一化多层状态的精细方向读取器。该设计恢复了足够的状态上下文来解释运动,而无需返回全状态探测。在训练期间未见过的推理基准上,我们的方法比仅位移的最先进技术将选择精度提高了 12%,比单层探测基线提高了 21%。尽管仅在推理基准上进行训练,但它也会在我们比较的每个检测器之前读取事实完成和事实验证,这将信号置于正确性而不是某种推理上。消融进一步表明运动、区域和方向提供了互补信号。这些结果表明,与仅从静态或脱离上下文的轨迹相比,从状态条件运动中可以更好地读取推理有效性。