论文

稀疏读出棱镜:用特征而不是标记来解释 logits-Lens 分数

Sparse Readout Prism: Explaining Logit-Lens Scores in Features Instead of Tokens

模型评测模型行为与机制分析

摘要

语言模型对其下一个标记的预测是跨层发展的,透镜方法通过将中间隐藏状态解码为标记来跟踪此过程。但是透镜读数反映了隐藏状态和用于解码它的读出(非嵌入矩阵)。许多镜头都适合语料库,并且我们表明,仅在拟合语料库上不同的两个镜头可以为相同的隐藏状态报告不同的标记。我们将这种依赖语料库称为条件性。为了独立于拟合语料库来检查读出结构,我们引入了稀疏读出棱镜(SRP),它仅使用其权重来分解读出,并将任何标记 logits 或 logits 差异表示为稀疏读出特征的贡献之和。这揭示了读出功能作为镜头读数的新分析单位,暴露了词元身份可能模糊的结构,并实现了词元、上下文、层和镜头之间的比较。用 SRP 的稀疏近似替换原始读数,与基于读数行之间的几何关系构建的六个基线中最强的基线相比,可以多重建 8.9-17.3 个百分点的测试 logits 差异。消除功能会按照其 SRP 贡献的比例改变 logits 差异。尽管标记读数随拟合语料库的不同而变化,但主要的读出特征保持稳定。由于 SRP 在其构建中不使用语料库,因此它为镜头分析提供了独立于拟合语料库的控制。