论文

VisKG-LM:将知识图编译成视觉记忆以进行多项选择题回答

VisKG-LM: Compiling Knowledge Graphs into Visual Memory for Multiple-Choice Question Answering

上下文与知识知识图谱

摘要

知识图通常通过使用图神经网络对检索到的子图进行编码并将其与在线推理路径中的语言模型融合来集成到问答中。因此,每次对一对子图进行评分时,在训练时期、种子和评估运行中,相同的子图都会从头开始重新编码,即使知识图永远不会改变。我们询问检索到的知识图是否可以离线编译一次,然后作为只读存储器访问。 VisKG-LM 通过将图编码与语言推理解耦来证明它可以。它将每个检索到的特定于候选的子图序列化为关系标记路径,并将结果渲染为图像,其二维布局保留了路径的分支结构。每个图像都会离线编码一次并缓存以供重复使用。在推理时,语言模型仅将文本中的问题和候选语置于上下文中,只有其最后一层会查阅缓存的视觉记忆,读取其全局布局和局部关系细节。因此,只有在理解了文本之后,才会输入图形信息。在 CommonsenseQA、OpenBookQA 和 MedQA-USMLE 的测试集上,VisKG-LM 分别比 GreaseLM 提高了 1.2 美元、0.8 美元和 4.3 美元点,同时匹配或超越了 GraphVis(一种 7 美元 B 美元的视觉语言模型,在线参数仅为约 400 $M 美元)。与接收相同关系标记路径的匹配纯文本控件相比,它在三个基准测试中获得了 4.2 美元、6.5 美元和 5.1 美元点。这些成果表明,完整的视觉记忆接口所增加的价值超出了单独的路径文本化的范围,并支持编译的视觉记忆作为在线图形传播的替代方案。