论文
Transformer语言模型上下文个体化测量工具包技术手册
Technical Manual for a Toolkit for Measuring Contextual Individuation in Transformer Language Models
摘要
Transformer 语言模型在其嵌入层将单个与上下文无关的向量分配给单词类型,但人们普遍认为可以通过后面层中的上下文来区分该单词的出现。干净地测试这种信念需要一个结构,该结构保持单词形式固定,而其上下文和预期含义以受控的、标记的方式变化。本手册记录了围绕这种结构构建的开放工具包,我们将其称为桥接形式:在两个或多个主题领域中重复出现、未更改的单个书面单词,每个主题领域具有不同的含义。我们描述并证明了管道的每个阶段:桥形式及其源域的声明性规范、从维基百科获取语料库、出现本地化、分层表示提取、模型表示空间中分离的域成对轮廓测量以及配对可视化协议。每个设计选择都与其要避免的方法故障模式一起呈现(来自过于宽泛的类别标签的感觉污染、轮廓系数的多组偏差、子词标记化错位以及降维图中的轴可比性伪影等)。本手稿是方法论和实施参考:它不报告或解释在任何特定模型或桥形式集上运行工具包的经验结果。该工具包、其完整源代码以及用于运用该工具包的语料库均以持久标识符单独存档(第 9 节),并旨在被使用该工具包生成和解释实证结果的研究作为工具引用。
