论文

当思想链失败时,解决方案隐藏在隐藏状态中

When Chain-of-Thought Fails, the Solution Hides in the Hidden States

模型评测模型行为与机制分析

摘要

中间推理在计算上是否有用或仅仅是解释性的取决于思想链 (CoT) 标记是否包含与任务相关的信息。我们使用激活补丁对 GSM8K 上的 CoT 进行机械因果分析:将 词元级 隐藏状态从 CoT 生成转移到同一问题的直接答案运行,然后测量对最终答案准确性的影响。在模型中,修补后生成的准确率比直接答案提示和原始 CoT 轨迹要高得多,这表明即使原始轨迹不正确,单个 CoT 词元也可以编码足够的信息来恢复正确的答案。这种与任务相关的信息在正确的 CoT 运行中比不正确的 CoT 运行更普遍,并且在词元之间分布不均匀,集中在中后期层并出现在推理跟踪中的较早位置。此外,修补动词和实体等语言标记携带解决任务的信息,引导一代人进行正确的推理,而数学标记则编码很少成功的接近答案的内容。修补后的输出通常更短,但超过了完整 CoT 跟踪的准确性,这表明完整的推理链并不总是必要的。总之,这些发现表明 CoT 编码可恢复的 词元级 问题解决信息,为推理如何表示以及推理在何处崩溃提供了新的见解。