论文
语言模型中语法性的隐式表示
Implicit Representations of Grammaticality in Language Models
摘要
语法性和可能性是人类语言中不同的概念。预训练语言模型 (LM) 是一种适合最大化语料库可能性的语言概率模型,生成语法良好的文本,并在严格控制的最小对中很好地区分语法句子和不语法句子。然而,它们的字符串概率总体上并不能严格区分语法句子和非语法句子。但是 LM 是否隐含地获得了与字符串概率不同的语法区别?我们通过研究 LM 的内部表示来探索这个问题,通过在语法和(合成)非语法句子数据集上训练线性探针,这些句子是通过对自然文本语料库应用扰动而获得的。我们发现这个简单的语法性探测可以推广到人类策划的语法性判断基准,并且优于 LM 基于概率的语法性判断。当应用于语义合理性基准时,其中最小对的两个成员都是语法上的并且仅在合理性上有所不同,但是探针的性能比字符串概率更差。经过英语训练的探针还表现出非凡的跨语言泛化能力,在许多其他语言的语法基准上优于字符串概率。此外,探测分数与字符串概率的相关性很弱。这些结果共同表明语言模型在其隐藏层中获得了一定程度的隐式语法区别。