论文
时空隐藏状态动力学作为 大语言模型 内部推理的特征
Spatiotemporal Hidden-State Dynamics as a Signature of Internal Reasoning in Large Language Models
摘要
大型推理模型(LRM)生成扩展的解决方案,但目前尚不清楚这些痕迹是否反映了实质性的内部计算,或者仅仅是冗长和过度思考。尽管最近的隐藏状态分析表明内部表示携带与正确性相关的信号,但它们的粗略聚合可能会掩盖推理计算底层的标记和层结构。我们研究了跨解码步骤和层的隐藏状态转换,并识别了 LRM 中独特的时空模式:成功的轨迹表现出广泛的时间动态和局部分层集中,而这种结构在非推理模型和知识密集型领域中较弱。我们将这一特征形式化为潜在转变的时空振幅(StALT),这是一种 无需训练 轨迹统计量,总结了由词元层内显着性加权的相邻词元之间的时间变化。在不同的模型和基准中,StALT 能够可靠地将推理密集型机制中的正确轨迹与错误轨迹区分开来,提供有竞争力的无标签正确性信号以及强大的输出空间和基于长度的基线。干预分析进一步表明,这种时空振幅对增加或减少内部推理需求的操作有系统的反应,支持其与 LRM 中潜在推理动态的关联。这些发现提供了经验证据,表明 LRM 表现出可测量的隐藏状态动态,并为理解基于输出的评估之外的内部计算提供了实用的探索。