论文
先推理再检索:面向多模态RAG的智能体规划
Reason Before You Retrieve: Agentic Planning for Multi-modal RAG
摘要
多模态检索增强生成(mRAG)旨在借助外部知识回答图文查询,但多数现有系统仍直接从原始多模态输入在平坦的证据空间中检索。这种设计常常难以应对两个关键挑战:检索目标欠明确,因为问题意图必须锚定到正确的视觉指涉对象;搜索空间结构化不足,迫使语义各异的证据在单一全局排序步骤中相互竞争。我们提出MM-R2,一个多模态智能体检索框架,通过显式建模“检索什么”与“到哪里搜索”实现先推理再检索。MM-R2首先从图像-问题对构建意图锚定的检索状态,捕获信息需求、锚定的指涉对象与检索约束。随后它在结构化的KnowledgeMap上执行检索:智能体先选择相关检索单元,再在其中发出锚定的查询。为实现这一能力,我们构建了MM-R2-Traj,一个大规模多步检索过程轨迹数据集,并采用监督微调与GRPO相结合的两阶段后训练策略。在Infoseek与Encyclopedic VQA数据集上的实验表明,MM-R2在答案准确率上大幅超越强基线,同时产生更可解释、更可验证的检索轨迹。
