论文

多模态检索增强生成的不确定性量化

Uncertainty Quantification for Multimodal Retrieval Augmented Generation

模型评测评测方法与指标

摘要

检索增强生成 (RAG) 通过整合外部知识提高了 大语言模型 (LLM) 的问答能力,最近已通过集成视觉和文本信息的视觉语言模型 (VLM) 扩展到多模态设置。尽管取得了这些进步,生成的答案仍然可能不正确或具有误导性。不确定性量化 (UQ) 方法旨在估计模型输出的可靠性,但大多数现有方法都是为纯文本模型设计的,在多模态 RAG 场景中表现不佳。一个关键的挑战是捕获管道多个阶段(包括检索、视觉理解和生成)产生的不确定性。在这项工作中,我们表明使用多模态和检索感知概率信号对不确定性进行建模可以改善多模态 RAG 系统中的估计。我们引入 LeMUQ,一种可学习的多模态 UQ 方法,用于分析输入修改(例如删除模态或检索上下文)下的标记概率。通过将这些信号编码为概率标记并使用微调模型对其进行处理,我们的方法捕获了模态和检索之间的交互。跨数据集、检索器 和 VLM 的实验表明,相对于基线和微调的 UQ 方法有一致的改进。我们提出的 LeMUQ 将 AUROC 指标平均提高了 3.8%。此外,我们的方法在不同的检索设置和数据集上显示出强大的泛化性能,在不同的 VLM 之间传输时具有混合结果。我们的研究结果强调了多模态不确定性建模的重要性,并为迈向更可靠、更安全的多模态 RAG 系统迈出了一步。代码可在 GitHub 上获取。