论文
超越线性概念:发现和对齐大语言模型中的非线性概念流形
Beyond Linear Concepts: Discovering and Aligning Non-Linear Concept Manifolds in Large Language Models
摘要
了解大语言模型 (LLM) 中的信息处理需要剖析其内部标记表示的几何组织。虽然现有的机械可解释性(MI)方法试图提取概念,但它们受到强线性假设的限制,该假设受到非线性特征流形证据的挑战。我们通过将非线性多维概念发现 (NLMCD) 从计算机视觉应用到标记级 LLM 激活,将概念建模为低维流形,超越了线性概念。为了比较跨层和模型的概念流形,我们引入了基于概念的对齐(CBA)分数,这是一种广义的 Rand 指数,无需显式特征匹配即可测量几何接近度。我们的分析得出了六个关键发现:(i) 相邻层健全性检查显示 CBA 比基于 PCA 或 CKA 的线性基线更敏感; (ii) 逐层对齐矩阵揭示了中间层和后期层的两个块结构,在模型之间保持一致,并被线性度量所掩盖; (iii) 概念构成在网络的大部分区域中仍然以语法为主,然后在后面的层中让位于日益混合的句法语义概念,并增加对最终层的输出导向; (iv) 英语和普通话之间的多语言概念共享依赖于训练而不是普遍的,Qwen 最强,Llama 较弱,GPT-2 不存在; (v) 模型间对齐反映了这种结构,不同规模的同族 Qwen 模型之间具有很强的对应性,但模型族之间的对齐较弱; (vi) 在 Tulu-3 训练阶段,相邻阶段之间的对齐程度最高,基础模型和 SFT 之间的变化最大,而后续的偏好对齐阶段(DPO、RLVR)使早期层基本保持不变,而 RLVR 在后期层中主要保留 DPO 的概念。