论文

利用语言与视觉模型的多模态文化遗产知识图谱扩展

Multimodal Cultural Heritage Knowledge Graph Extension with Language and Vision Models

上下文与知识知识图谱

摘要

文化遗产的保护与阐释日益依赖数字技术,其中知识图谱(KG)因能够结构化海量数据而脱颖而出。然而,由于文化遗产信息多样而复杂的性质,这些知识图谱的构建与扩展常常面临挑战。本文提出一种扩展文化遗产领域知识图谱资源的新方法,并将其应用于法语数据。首先,我们推出法国文化遗产领域的新知识图谱WJoconde,其突出特点在于多模态性,同时整合实体的文本与图像信息。我们进一步提供WJoconde的三个变体,以便于知识图谱补全(KGC)等下游研究。我们还在自己的数据集上为KGC方法构建了全面的基准。其次,我们提出一个利用大语言模型(LLM)与视觉语言模型(VLM)的多模态方法来扩展文化遗产知识图谱的新框架,其中包括从非结构化资源自动抽取数据,并结合专门的验证流水线对两个模型的输出进行落地校验,从而进一步扩展WJoconde。我们的结果表明,通过整合文化遗产数据中丰富的文本与图像信息,能够以高可靠性高效增强知识图谱。我们开源了全部代码、包含文本与图像的基准数据集,以及带交互式访问入口的原始数据。