论文
LLaMA 3.1 8B 中结构感知数值推理的机械可解释性
Mechanistic Interpretability of Structure-Aware Numerical Reasoning in LLaMA 3.1 8B
摘要
最近的工作表明,大语言模型 (LLM) 表现出强大的数值序列建模能力,并在时间序列预测方面显示出前景。虽然 LLM 显示了上下文学习能力,但它们完成时间序列预测的机制仍不清楚。具体来说,他们是否真正理解了底层结构,这至少需要对数字序列中的第一个差异进行推理。为了研究这一点,我们从机械解释的角度研究了 Llama 3.1-8B。机械可解释性是一个新兴领域,涉及对 LLM 等神经网络学习的算法进行逆向工程。为了评估 Llamas 的数值序列建模能力并促进我们的机械可解释性分析,我们创建了一个序列建模任务,如果不获取结构线索就无法解决该任务。具体来说,我们对 n 个随机数进行采样,并以偏移量重复它们。我们发现 Llama 在我们的任务中表现出了出色的表现,这表明它可以识别底层结构。为了了解允许其这样做的机制,我们进行了探测实验和基于激活补丁的反事实分析。探测表明,该模型在没有显式监督的情况下计算并存储其内部表示的一阶差异,这表明它跟踪有关序列的结构信息。激活修补揭示了 Llama 使用类似于感应电路的机制检索相关的一阶差分,然后将其添加到当前值。值得注意的是,我们的工作是在 LLM 中识别这种形式的概念归纳的首批研究之一。