论文

HANIA:规划器引导的多模态图证据选择,支持有据可依的问答

HANIA: Planner-Guided Multimodal Graph Evidence Selection for Grounded Question Answering

上下文与知识上下文工程

摘要

多模态问答仍然对嘈杂、不完整和基础薄弱的证据敏感。长的非结构化上下文可能会引入冗余并鼓励无支持的生成,而平面检索可能会忽略多步骤推理所需的关系。我们提出了 HANIA,一个规划者引导的多模态图框架,用于基于证据的问答。 HANIA 使用冻结的视觉语言模型处理提供的图像和文本,以提取简洁的与问题相关的视觉证据,并明确弃权。然后,它构建一个基于输入的多模态图,并应用两组有限状态规划器来协调描述性和关系性证据。覆盖感知修剪保留了基于相关性、图形置信度、概念覆盖率和模态多样性的紧凑证据集。选定的段落、视觉陈述和图形三元组被提供给冻结指令调整的解码器。我们使用答案准确性、证据过滤质量、证据预算敏感性和效率来评估 ScienceQA 上的 HANIA。结果表明,结构化证据规划和紧凑的图形引导检索可以支持竞争性多模态问答,而无需目标数据集微调或迭代检索。代码可在 https://github.com/Zafar-southeast/HANIA 获取。

HANIA:规划器引导的多模态图证据选择,支持有据可依的问答:论文配图
图1:阿富汗的建筑。输入依据的多模态证据是通过有限的状态规划和覆盖意识在冷冻解码器预测之前进行排查来安排的。