论文

LLM 中的逻辑子空间

Logical subspace in LLMs

模型评测模型行为与机制分析

摘要

最近的工作已经确定了专门用于抽象形式推理的人脑网络(Kean 等人,2025)。语言模型也是如此吗?为了回答这个问题,我们引入了最小可行子空间(MVS)方法,该方法在一层中搜索最低秩激活子空间,当该子空间之外的所有内容都被消除时,该层可以保留任务性能。使用 MVS,我们演示了支持 Gemma 和 Qwen 模型逻辑推理的低秩子空间。此外,这些子空间表现出与其他任务的模型能力明显分离,因此保留这些后期逻辑子空间可以保留推理,同时损害事实知识、工作记忆、认知控制和算术。相反,消除它们会降低逻辑推理的准确性,同时在很大程度上保留这些其他能力。我们的研究结果表明,存在一种功能上可本地化的核心逻辑机制,类似于人脑中的逻辑机制。