论文

聚集而非准入:注意力如何将一个潜在变量带入可言语化的形式

Gathered, Not Admitted: How Attention Brings a Latent Variable into Verbalizable Form

模型评测模型行为与机制分析

摘要

语言模型以一种可供其报告的形式持有潜在量,当任务需要灵活复用该量时,该形式中存在更多的量。是什么使一个表示进入这种形式仍是开放问题,而“工作区”一词暗示了一种准入故事:一个决定什么可以进入的门。我们在开放权重模型上用雅可比透镜检验它,使用一个五个分支共享完全相同上下文的基准,我们发现门预测存在之处并没有门。需求使一个概念的透镜可见度超出对给定值施加算子所产生的水平:在主检查点上百分位排名+0.050 [+0.045, +0.057],在我们测量的四个检查点上均为正,尽管该分支在天花板水平作答且在该读出下精度匹配的对比更强。与此同时,一个共享线性映射能从包括对照在内的每个分支解码该变量,达到其选择校正下限的6.4-9.0倍。在查询位置产生后续可读形式的是中深度窗口内注意力介导的聚集:将补丁深度与读出深度分离后,在非饱和读出下,传输到该处的强度至少是更浅处的17倍,且窗口内没有任何被测MLP输出产生正贡献。在饱和百分位排名下,同一网格无法定位该窗口,这是该度量本身的事实。一个不需要该变量的分支聚集程度低七倍,因此该窗口是需求特异的。该窗口有两个测量边界:其下是存续失败,其上是破坏,且它在一个64层混合模型与另一家族的62层稠密模型中落在相同的相对深度。我们定位了变量被安装和读取的位置,而非来自文本通路的路线,后者不传输任何东西。但该读出不是使用量的校准度量:三个组件将其移动到彼此相差12%以内,而它们对答案的作用相差7.4倍。

聚集而非准入:注意力如何将一个潜在变量带入可言语化的形式:论文配图
图1:当任务要求灵活复用潜变量 z 时,关于何者发生变化的两种解释。(a) “准入”(Admission),按 workspace 词汇表所引导的读法:z 在每个深度都处于查询位置,由一个门控决定它是否进入。这是我们对这一假设的形式化,并非 Gurnee 等人(2026)提出的论断。(b) 我们所测量的:注意力在一个中等深度的窗口内将 z 聚合(gather)到查询位置,安装在其下方的值无法存留到读出(readout),答案对整合后信息流的依赖远大于对聚合本身的依赖。该段落是可能的来源,但我们并未对其进行定位。(b) 在查询位置上取代了 (a);它并不排除存在作用于聚合过程本身的门控。(b) 中标注的重新推导是我们对下边缘更倾向的解读,而非测量结果(§5)。