论文
VISPATH:多模态知识图问答的视觉意图引导路径推理
VISPATH: Visual-Intent-Guided Path Reasoning for Multimodal Knowledge Graph Question Answering
摘要
知识图问答(KGQA)使模型能够通过结构化图推理回答自然语言问题,并在许多基准测试和应用程序中取得了实质性进展。最近,多模态 KGQA(MM-KGQA)引起了越来越多的关注,因为许多问题需要联合使用多模态输入和 KG 证据。然而,现有的 MM-KGQA 方法通常仅使用多模态信息来启动实体基础或证据检索,之后多跳推理退化为纯文本图搜索。因此,他们无法利用在中间跳跃中变得重要的多模式线索。为了解决这个限制,我们提出了 VISPATH,一种用于 MM-KGQA 的视觉意图引导路径推理框架。 VISPATH 首先通过将多模态基础与图形结构线索相结合来识别可靠的起始实体。然后,它通过根据输入、问题和当前部分路径重新计算特定于跳的多模态意图来执行意图引导的路径发现,以便每次扩展都由当前推理状态引导。发现的路径通过推理链修剪进一步细化,推理链修剪根据候选路径与问题、推理草图和特定跳跃意图的一致性将候选路径评估为完整的证据链。最后,VISPATH 检查所选证据是否足以生成答案。我们进一步构建了 VISPATH-Bench,这是一个评估 KG 上多模态多跳推理的基准,涵盖了需要在 KG 路径上进行两到四跳的问题。对 VISPATH-Bench 和另外三个多模式 QA 基准的大量实验表明,VISPATH 始终优于强大的基线。值得注意的是,以 GPT-4o 作为骨干,VISPATH 在 VISPATH-Bench 上超越了 GPT-5.4,平均准确率相对提高了 10.6%,2 跳推理提高了 13.1%。