论文
用于多模态检索增强生成的面向效用的视觉证据选择
Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation
摘要
视觉证据选择是多模态检索增强生成(RAG)的关键组成部分,但现有方法通常依赖于语义相关性或表面水平相似性,这通常与下游推理的视觉证据的实际效用不一致。我们通过将证据效用定义为模型输出分布引起的信息增益,从信息论的角度重新表述多模式证据选择。为了克服答案空间优化的棘手问题,我们引入了证据有用性的潜在概念,并从理论上证明,在温和的假设下,通过该潜在变量的信息增益对证据进行排序相当于答案空间效用。我们进一步提出了一个 无需训练,代理加速框架,它使用轻量级多模态模型有效地估计证据效用。跨多个模型系列的 MRAG-Bench 和 Visual-RAG 实验表明,我们的方法始终优于最先进的 RAG 基线,同时大幅降低了计算成本。