论文

通用 NLP 嵌入是否捕获本体推理?

Do General NLP Embeddings Capture Ontological Reasoning?

模型评测基准与评测资源

摘要

通用 NLP 嵌入模型在语言任务上表现良好,但它们捕获符号本体结构的能力仍不清楚。我们介绍了 AVA,这是一个系统框架,用于评估嵌入是否区分本体和知识图中逻辑敏感的关系语义。 AVA 包含 171,007 个对比三元组,这些三元组源自使用层次结构反转、关系替换和不相交注入的 163 个异构本体。每个三元组包含一个本体论陈述、一个语义等效的释义和一个具有矛盾关系含义的逻辑敏感的硬否定。我们评估了超过 25 个最先进的嵌入模型,发现了很大的局限性:最好的模型仅达到 0.739 三元组精度,而硬负精度则降至 0.135。 微调 大幅提高了区分度,但向下游语义网任务(包括分类法发现和本体对齐)的转移效果很差。进一步的分析表明,改进部分源于扰动特定的模式识别,而不是强大的本体论理解。这些发现揭示了语言表征学习和本体层面的辨别之间持续存在的差距,挑战了强大的 NLP 基准性能可以转化为语义网能力的假设。