论文
VL-KGE:当视觉语言模型遇上知识图谱嵌入
VL-KGE: Vision-Language Models Meet Knowledge Graph Embeddings
摘要
现实世界的多模态知识图谱(MKG)天然异构,其建模的实体关联着多样模态。传统知识图谱嵌入(KGE)方法擅长学习实体与关系的连续表示,但通常为单模态设置设计。近期方法把 KGE 扩展到多模态设置但仍受限,常常孤立处理各模态导致跨模态对齐薄弱,并依赖如实体模态可用性一致这类过于简单的假设。视觉语言模型(VLM)提供了在共享嵌入空间内对齐多样模态的有力途径。我们提出视觉语言知识图谱嵌入(VL-KGE),一个把 VLM 的跨模态对齐与结构化关系建模结合、学习知识图谱统一多模态表示的框架。在 WN9-IMG 和两个新的艺术类 MKG(WikiArt-MKG-v1 与 WikiArt-MKG-v2)上的实验表明,VL-KGE 在链接预测任务上持续超越传统单模态与多模态 KGE 方法。结果凸显 VLM 对多模态 KGE 的价值,使大规模异构知识图谱上更稳健、更结构化的推理成为可能。
