论文
句子编码器中的概念表示原理
Principles of Concept Representation in Sentence Encoders
摘要
是什么让句子编码器产生良好的概念表示?我们通过表征组合性的视角来解决这个问题:只有当编码器的潜在空间允许相应语义运算符的低失真实现时,编码器才支持概念族。这个框架预测了当前编码器在哪里成功,以及它们在结构上与监督不匹配的地方。通过对来自 WordNet 和 Wiktionary 的 330 万个同义词和定义对进行训练的编码器条件的受控消融,对三个去污分割和修饰符标记的名词短语基准进行评估,我们确定了四个原则。 微调 重新校准潜在几何图形而不是扩展它 (P1)。在特定于概念的训练开始之前,语义信号集中在最后的 Transformer 层,从而使跨层池化变得多余(P2)。硬负例提高了区分度和压力测试的稳健性,但没有提高检索排名,这表明校准和排名是独立可寻址的(P3)。最后,监督的有效性取决于目标概念的构成类型。外延训练有助于交叉和分属家庭,同时降低关系和内涵家庭,暴露出当前训练范式的结构局限性(P4)。我们发布了两个新的评估数据集:DBpedia 语义差距基准和修饰符标记的 NP 释义套件。