论文
聚集而非准入:注意力如何将一个潜在变量带入可言语化的形式
Gathered, Not Admitted: How Attention Brings a Latent Variable into Verbalizable Form
摘要
语言模型以一种可供其报告的形式持有潜在量,当任务需要灵活复用该量时,该形式中存在更多的量。是什么使一个表示进入这种形式仍是开放问题,而“工作区”一词暗示了一种准入故事:一个决定什么可以进入的门。我们在开放权重模型上用雅可比透镜检验它,使用一个五个分支共享完全相同上下文的基准,我们发现门预测存在之处并没有门。需求使一个概念的透镜可见度超出对给定值施加算子所产生的水平:在主检查点上百分位排名+0.050 [+0.045, +0.057],在我们测量的四个检查点上均为正,尽管该分支在天花板水平作答且在该读出下精度匹配的对比更强。与此同时,一个共享线性映射能从包括对照在内的每个分支解码该变量,达到其选择校正下限的6.4-9.0倍。在查询位置产生后续可读形式的是中深度窗口内注意力介导的聚集:将补丁深度与读出深度分离后,在非饱和读出下,传输到该处的强度至少是更浅处的17倍,且窗口内没有任何被测MLP输出产生正贡献。在饱和百分位排名下,同一网格无法定位该窗口,这是该度量本身的事实。一个不需要该变量的分支聚集程度低七倍,因此该窗口是需求特异的。该窗口有两个测量边界:其下是存续失败,其上是破坏,且它在一个64层混合模型与另一家族的62层稠密模型中落在相同的相对深度。我们定位了变量被安装和读取的位置,而非来自文本通路的路线,后者不传输任何东西。但该读出不是使用量的校准度量:三个组件将其移动到彼此相差12%以内,而它们对答案的作用相差7.4倍。
