论文

VL-KGE:当视觉语言模型遇上知识图谱嵌入

VL-KGE: Vision-Language Models Meet Knowledge Graph Embeddings

上下文与知识知识图谱

摘要

现实世界的多模态知识图谱(MKG)天然异构,其建模的实体关联着多样模态。传统知识图谱嵌入(KGE)方法擅长学习实体与关系的连续表示,但通常为单模态设置设计。近期方法把 KGE 扩展到多模态设置但仍受限,常常孤立处理各模态导致跨模态对齐薄弱,并依赖如实体模态可用性一致这类过于简单的假设。视觉语言模型(VLM)提供了在共享嵌入空间内对齐多样模态的有力途径。我们提出视觉语言知识图谱嵌入(VL-KGE),一个把 VLM 的跨模态对齐与结构化关系建模结合、学习知识图谱统一多模态表示的框架。在 WN9-IMG 和两个新的艺术类 MKG(WikiArt-MKG-v1 与 WikiArt-MKG-v2)上的实验表明,VL-KGE 在链接预测任务上持续超越传统单模态与多模态 KGE 方法。结果凸显 VLM 对多模态 KGE 的价值,使大规模异构知识图谱上更稳健、更结构化的推理成为可能。

VL-KGE:当视觉语言模型遇上知识图谱嵌入
图1:来自WN9-IMG数据集 ( Xie et al., 2017 ) 的示例三元组。实体对应于 ImageNet ( Deng et al., 2009 ) 的同义词集(synset),由图像集合(红色显示)及其 WordNet ( Miller, 1995 ) 文本定义(青色显示)表示,并通过语义关系相连接。