论文
MEG-RAG:量化 RAG 中证据选择的多模式证据基础
MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG
摘要
多模态检索增强生成 (MRAG) 解决了多模态 大语言模型 (MLLM) 的关键限制,例如幻觉和过时的知识。然而,当前的 MRAG 系统很难区分检索到的多模态数据是否真正支持答案的语义核心或仅提供表面相关性。现有的指标通常依赖于基于位置的启发式置信度,这无法捕获多模式实体的信息密度。为了解决这个问题,我们提出了多模式证据基础(MEG),这是一种语义感知指标,可以量化检索到的证据的贡献。与标准置信度测量不同,MEG 利用语义确定性锚定,重点关注高 IDF 信息承载标记,以更好地捕获答案的语义核心。在 MEG 的基础上,我们引入了 MEG-RAG,这是一个训练多模态重新排序器的框架,用于将检索到的证据与 真值 的语义锚对齐。通过根据语义基础而不是词元概率分布优先考虑高价值内容,MEG-RAG 提高了生成输出的准确性和多模态一致性。对 M$^2$RAG 基准的大量实验表明,MEG-RAG 始终优于强大的基线,并在不同的教师模型中表现出强大的泛化能力。