论文
概念耳语:光谱反集中和 Transformer 表示的对偶几何
Concepts Whisper: Spectral Anti-Concentration and the Dual Geometry of Transformer Representations
摘要
我们发现 Transformer 概念表示系统地反集中在非嵌入协方差的谱尾中,在 17 个模型核心套件和 22 个语义概念类别的扩展集上以低方差方向编码词级概念,并通过三种独立提取方法进行聚合复制。剩余流均值差向量在所有 17 个模型中都反集中(模型级单样本 t 检验,p = 3.8e-9),并且在 17 个模型中的 13 个中保持比规范匹配随机方向更尾部对齐;收敛支持来自稀疏自动编码器 (SAE) 特征(模型内各个概念的 p = 4.5e-19)以及 Llama 和 Qwen 上的线性探针。我们确定了对偶几何:激活空间概念方向反集中,而静态非嵌入行对比集中在高方差方向(p < 10^-4)。这项调查源于测试 Park 等人的因果内积是否。 (2024) 帮助跨语言概念传输;对 17 个模型和 4 个语言对进行的匹配谱随机化没有发现任何证据表明白化因果对齐比单独的谱正则化有改善 (p = 0.95)。分流注入干预(仅限于双臂保持可解释的转向强度)显示了五个模型中的四个(将 Cohen 的 d_z 配对至 1.19)中预测的干扰不对称性,在该范围内没有显着逆转,并且跨八个模型的 POS 标签探测显示在八个架构中的六个中语法优先编码在高方差子空间中,在 Qwen 2.5 系列中出现了显着逆转。这些结果表明,Transformer 在上下文处理期间将语义内容旋转到光谱安静区域,在某些架构中,相对于高方差转向,干预可能会减少语法中断。