论文
纯化多模态检索:RAG 的片段级证据选择
Purifying Multimodal Retrieval: Fragment-Level Evidence Selection for RAG
摘要
多模态检索增强生成 (MRAG) 被广泛应用于多模态 大语言模型 (MLLM),并有外部证据来减少幻觉。尽管取得了成功,但大多数现有的 MRAG 框架将检索到的证据视为不可分割的文档,隐含地假设文档中的所有内容都具有同等的信息量。然而,在实践中,有时文档中只有一小部分与给定查询相关,而其余内容会引入大量噪音,可能导致性能下降。我们通过将 MRAG 重新定义为细粒度的证据选择问题来解决这一基本限制。我们提出了 RAG 片段级证据选择(FES-RAG),这是一个选择原子多模态片段而不是整个文档作为基础证据的框架。 FES-RAG 将检索到的多模态文档分解为句子级文本片段和区域级视觉片段,从而能够精确识别直接支持生成的证据。为了指导片段选择,我们引入了片段信息增益(FIG),这是一个原则性指标,用于衡量每个片段对 MLLM 生成置信度的边际贡献。基于Fig,我们将高容量MLLM中的片段级效用判断提炼为轻量级选择器,以较低的推理开销实现了准确的证据选择。 M2RAG 基准测试表明,FES-RAG 始终优于最先进的文档级 MRAG 方法,在 CIDEr 中实现高达 27% 的相对改进。通过选择更少但信息更丰富的片段,我们的方法大大减少了上下文长度,同时提高了事实准确性和生成一致性。