论文
LLM 中的推理是否由不同的语义结构介导?机械解释
Is Inference Mediated by Distinct Semantic Structures in LLMs? A Mechanistic Interpretation
摘要
正确预测标签并不一定需要表示产生它的操作。已知 Transformer 表示携带标签级信息,但它们是否编码产生这些标签的语义操作尚不清楚。我们使用受控前提-假设对在自然语言推理中对此进行研究,这些前提-假设对的不同之处在于单个语义转换。使用逐层激活,我们通过 SVD 估计操作级子空间,并通过四个开放权重解码器模型中的激活控制来测试它们的因果相关性。变换效果的解码精度为 $84.8$-$99\%$,并占据部分不同但重叠的子空间,超过随机子空间基线。转向实验表明,尽管不同模型的转向能力有所不同,但这些方向会因果影响预测。交叉操作转向进一步揭示了子空间选择性和交叉操作独立性之间的结构化干扰和分离。这些发现表明,模型不仅编码与前提相关的假设,而且部分地编码它是如何做到这一点的,这意味着机械分析和控制应该在语义操作的层面上进行操作,而不仅仅是预测标签。