论文
思想链表层之下:《LLM》中推理操作的机械解释
Beneath the Surface of Chains-of-Thought: A Mechanistic Interpretation of Reasoning Operations in LLMs
摘要
大语言模型 中的推理通过各种功能操作展开,例如问题表述、目标分解和演绎。尽管这些操作在文本中被明确区分,但人们对它们在表示空间中如何进行几何组织却知之甚少。为此,我们研究不同的推理操作是否在隐藏表示中表现出相应的几何结构。我们发现操作在保留表示中是可分离的,可分离性在中间层达到峰值,并验证该结构不能由词汇或位置混淆来解释。在各个层之间,标记方式的操作对齐在跨度上变得更加分布,而相同的表面标记根据其周围块的操作而以不同的方式表示。注意掩盖干预进一步表明,块开始时的操作对齐表示取决于先前的推理上下文。因此,我们的工作表明,语言模型维持语言推理表达式与其内部几何结构之间的表征对应关系。代码和项目材料可在 https://github.com/naver-ai/beneath-cot 获取。