论文

多模态生成模糊系统:模糊推理引导的大模型交互式问答框架

Multi-Modal Generative Fuzzy System: Fuzzy Inference Guided Large Model Interactive Question Answering Framework

模型推理推理策略与问题分解

摘要

在多模态问答(MQA)中,模型需要联合编码和集成来自多种模态(包括文本、图像和语音)的异构信息,以执行复杂的语义推理和决策。尽管最近取得了进展,但现有的方法,包括传统的深度学习模型和大型模型 (LM) 或基于提示的框架,仍然面临着一些关键挑战。首先,模态偏差是由不同模态之间的特征分布差异引起的,这限制了有效的跨模态协作理解。其次,许多问题需要来自多个领域的知识,从而引入了很大的不确定性。第三,当前的方法通常依赖于浅层语义匹配,导致推理深度有限,可解释性降低。为了解决这些问题,受传统模糊系统(FS)框架的启发,我们提出了一种模糊推理引导的多模态生成架构,称为多模态生成模糊系统(MMGFS)。 MMGFS 的主要贡献有两个方面。首先,它通过多模态协作反思机制减轻模态偏差。其次,引入模糊规则和多跳推理机制,支持跨领域知识融合和层次推理,从而加强不确定性建模,加深语义理解。我们对开放域问答数据集(包括 MultimodalQA 和 WebQA)以及特定领域的基准(包括 BioMol-VQA 和 EHRxQA)进行全面评估。实验结果表明,MMGFS 在多个数据集上始终优于现有方法。它有效地减轻了模态偏差和问题的不确定性,同时在答案准确性、一致性和泛化方面实现了卓越的性能。