论文

超越 Logit 透镜的概念子空间计算:用于定位读数上游表示的仅权重测试

Concept Subspaces Compute Beyond the Logit Lens: A Weights-Only Test for Locating Representations Upstream of Readout

模型评测模型行为与机制分析

摘要

概念子空间对模型行为的影响并不能确定它与输出读数的关系。我们引入了一种双边几何诊断,用于测量提取的子空间与非嵌入矩阵的主导右奇异方向的重叠,并根据面向输出的正控制进行评估。给定提取的基础,原始诊断仅需要模型权重。我们的测试平台是与格式无关的推理子空间(FARS),这是从以六种表面形式表达的十八个推理概念中提取的十维基础。在九个等级匹配的估计器和二十六个模型中,四个激活衍生的概念估计器在前十个读出范围中仅携带 0.38--0.80% 的平均能量。最终层 PCA 占 3.56%,在 26 个模型中的 25 个模型中超过了 FARS。使用合适的线性转换器进行深度匹配评估的同层下一个词元控制所携带的能量大约是 FARS 的 13 倍,并且在所有 25 个测试模型中都存在分离。对 10 个不相交概念重新提取 FARS 可在 24 个生成模型中产生 62--100% 的跨格式检索,这证明了提取过程的转移而不是固定基础。一项互补的四模型、三种子干预研究发现,模型依赖的源导向效应仍远低于全载体替代。几何和干预控制共同区分概念结构和主导读出方向,同时限制因果充分性的主张。