论文
模态相关性不是模态实用性:成本感知多模态 RAG 的事后选择性模态升级
Modality Relevance is not Modality Utility: Post-hoc Selective Modality Escalation for Cost-Aware Multimodal RAG
摘要
多模态检索增强生成(RAG)将生成器建立在从异构模态(文本、表格和图像)中提取的证据中。主要的部署选择是二进制的,并且在模型尝试回答之前进行:要么运行廉价的文本(+表)管道,要么为每个图像支付昂贵的视觉语言模型(VLM)。最近的自适应系统通过从需要哪种模态的问题条件预测器中选择模态或保真度预检索来改进这一点。我们证明这是错误的决策点。通过对 MultiModalQA 的预言机余量分析,我们发现模态与问题的相关性对于该模态是否确实需要正确回答来说是一个弱预测因素:大部分其标准支持证据包括图像的问题仍然可以仅通过文本和表格来回答,并且根据明显的视觉相关性升级的预检索路由器相对于预言机来说大大过度升级。我们提出 \textbf{事后选择性模态升级}:从文本和表格中廉价地回答,在(查询、草稿答案、证据)元组上运行验证器来定位缺少的模态,并仅在此处支付 VLM 证据的费用。然后,经过校准的升级值路由器会决定预期的准确性增益是否证明视觉成本合理。在 MultiModalQA 上,我们的路由器恢复了始终在线的 VLM 管道的准确性,同时发出的视觉调用少得多,并缩小了与预言机升级率的大部分差距。结果将为检索深度和推理跳跃而建立的路由信号层次结构扩展到第三个轴——模态——在单一成本感知选择性升级视图下。