论文

语言模型语义空间中的关系几何

Relation Geometry in Semantic Space of Language Models

模型评测模型行为与机制分析

摘要

在生成单词的向量表示时,当前的语言模型正在取得高质量的结果。然而,我们不知道的是,关于语义关系的知识在以这种方式创建的语义空间的几何形状中表示的程度。为了回答这个问题,我们从三个角度研究这种语义空间的关系几何。我们首先检查与目标词处于特定关系(称为relata)的词是否占据语义空间中的同一区域,以及不同关系对应的区域是否彼此不同。然后,我们验证语义空间在多大程度上反映了关系的某些众所周知的属性,例如对称性、不对称性和传递性。最后,我们考虑关于目标词和相关性的哪些信息对于关系几何更重要:它们的表面形式,还是它们的上下文。我们使用因果、屏蔽和扩散语言模型对六种语义关系进行实验。结果表明,不对称关系中的relata在语义空间中相对明显地占据着独特的区域。非对称关系的属性在语义空间中的编码程度还算不错,但比对称关系的属性要好。此外,当考虑哪个信息源对我们评估的模型中的结果影响最大的问题时,我们发现词汇信息对于因果语言模型往往更重要,而上下文信息对于掩码和扩散语言模型更重要。我们的结果凭经验表明,关系几何并不能很好地代表语义空间中的所有关系,这表明仅从分布信息中学习语义关系的效果存在差异。