论文

CLIMB:多模态RAG的置信引导互补证据

CLIMB: Confidence-Guided Complementary Evidence for Multimodal Retrieval-Augmented Generation

上下文与知识检索增强

摘要

多模态大语言模型(MLLM)展现强视觉推理能力,但知识密集的视觉问答常需要图像与参数知识之外的外部文本证据。现有多模态RAG系统通常依赖Top-K检索或重排,可能返回冗余段落,且对答案更新是否被检索证据充分支撑控制有限。我们提出CLIMB——多模态RAG的训练自由推理时框架:先用MMR式目标(平衡查询相关性与段落级冗余)构建紧凑互补证据池;再在该固定池内执行置信受控的精化:R/E/C评论家按相关性、证据特异性与跨模态对齐为段落打分,证据接地的置信估计器仅在估计置信上升时接受更新后的答案。这一设计提供简单停止判据并减少不必要精化,无需修改底层检索器或MLLM。Encyclopedic-VQA与InfoSeek实验显示CLIMB一致优于检索增强多模态基线;消融进一步表明互补池化、基于评论家的打分与迭代置信受控精化各有贡献。