论文
ViSR-KGC:用VLM进行视觉子图推理以补全多模态知识图谱
ViSR-KGC: Visual Subgraph Reasoning with Vision-Language Models for Multimodal Knowledge Graph Completion
摘要
知识图谱完成(KGC)旨在从不完整的图结构中推断缺失的实体或关系。它演进为多模态知识图谱完成(MMKGC),其中实体与文本和图像等多模态形式关联。传统的表示学习方法遵循嵌入式范例,但在缺乏特定关系证据的情况下可能难以进行推理。与此同时,基于语言模型(LLM)的推理方法通常将图结构线性化为文本提示,这遮蔽了图结构的拓扑,并忽视了关键的视觉信息。虽然视觉-语言模型(VLMs)在多模态推理方面表现出色,但它们无法原生地解析结构化的图拓扑,特别是在知识图谱中,节点和边携带复杂的语义。为了弥合这一差距,我们提出了一种视觉子图推理方法——ViSR-KGC。它整合了三种互补的能力来捕捉语义相关性:通过表示学习识别全局拓扑依赖,使用VLMs分析多模态证据,并在预训练模型中提供必要的常识知识。基于学习到的多模态嵌入,我们的框架首先从MMKG中提取一个紧凑且查询导向的子图。然后,这个子图被转换为视觉可解释的图像,通过实验比较选择的布局策略。最后,将可视化子图、实体图像、文本描述和候选答案组合成统一提示,使VLM能够推断缺失的实体。
