论文

Transformer语言模型上下文个体化测量工具包技术手册

Technical Manual for a Toolkit for Measuring Contextual Individuation in Transformer Language Models

模型评测评测方法与指标

摘要

Transformer 语言模型在其嵌入层将单个与上下文无关的向量分配给单词类型,但人们普遍认为可以通过后面层中的上下文来区分该单词的出现。干净地测试这种信念需要一个结构,该结构保持单词形式固定,而其上下文和预期含义以受控的、标记的方式变化。本手册记录了围绕这种结构构建的开放工具包,我们将其称为桥接形式:在两个或多个主题领域中重复出现、未更改的单个书面单词,每个主题领域具有不同的含义。我们描述并证明了管道的每个阶段:桥形式及其源域的声明性规范、从维基百科获取语料库、出现本地化、分层表示提取、模型表示空间中分离的域成对轮廓测量以及配对可视化协议。每个设计选择都与其要避免的方法故障模式一起呈现(来自过于宽泛的类别标签的感觉污染、轮廓系数的多组偏差、子词标记化错位以及降维图中的轴可比性伪影等)。本手稿是方法论和实施参考:它不报告或解释在任何特定模型或桥形式集上运行工具包的经验结果。该工具包、其完整源代码以及用于运用该工具包的语料库均以持久标识符单独存档(第 9 节),并旨在被使用该工具包生成和解释实证结果的研究作为工具引用。

Transformer语言模型上下文个体化测量工具包技术手册:论文配图
(a) 电桥形成电流,三个域。(b) 电桥形成电荷,三个域。图 2:工具包标准输出的两个示例:成对的 PCA 散点图(嵌入层,左;最终层,中)和成对的逐层轮廓曲线(右)。显示这两次运行只是为了说明本节中描述的输出格式:面板布局、标记/颜色编码和轴约定。第二个例子也恰好说明了面板中的三对曲线不必重合:其中两条在整个图层范围内紧密相连,而第三条则明显分开,这就是该显示器旨在使之清晰易读的模式。与第 1 节中所述的范围一致,此处没有解释为什么任何特定对的行为如此;每个面板恰好显示的具体模式没有被报告、解释或概括为本手稿的发现。