论文

融合之前的信任:QIMG-7 和污染多模式 RAG 的源感知解决方案

Trust Before Fusion: QIMG-7 and Source-Aware Resolution for Polluted Multimodal RAG

模型评测基准与评测资源

摘要

多模态检索增强生成(RAG)通常使用干净的证据进行评估,但真正的检索可能会返回主题相关但不可靠的内容:来自损坏的元数据、实体交换、印刷覆盖、语义编辑、对抗性补丁、混合或风格转换的虚假文本和误导性图像。我们引入了 QIMG-7,这是多句子事实 QA 中多模态检索污染的受控基准,涵盖四个数据集、七个图像攻击系列和 16 个配对的清洁/污染方案,每种方法有 1,760 个评估行。在四个生成器/门堆栈中,朴素的多模式融合很脆弱:在主 gpt-4o-mini 堆栈中,Full-MM 支持从干净文本的 0.908 下降到污染文本的 0.490,通常使参数回退比检索更安全。我们提出源感知信任解析 (SATR),这是一种 无需训练 方法,它比较参数化、纯文本和全 MM 候选答案,并根据源可靠性在候选答案中进行选择或回退。字段选择器变体实现了最佳平衡分数 0.816,比 Full-MM 提高了 11.7 分,比级联路由器提高了 2.7 分。消融表明,在这种文本优先的环境中,显式文本可靠性建模是这些收益的主要驱动力。总的来说,在具有多模态检索冲突的文本优先事实问答中,我们的结果支持选择性信任而不是无条件融合。工件可在 https://github.com/SaadElDine/Trust_Before_Fusion 获取。