论文

MC-Search:用结构化长推理链评估与增强多模态Agentic搜索

MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains

智能体系统Agent任务评测

摘要

随着对逐步、跨模态和知识锚定推理需求的增长,多模态大语言模型(MLLM)正从传统的固定“先检索后生成”范式演化为更复杂的智能体式多模态检索增强生成(MM-RAG)。然而,现有基准主要聚焦于短检索链的简化问答,对自适应规划与多模态推理的探索不足。我们提出MC-Search,首个面向智能体式MM-RAG的基准,带有横跨五种代表性推理结构的长、逐步标注推理链。每个样例规定子问题、检索模态、支持事实和中间答案,其保真度由HAVE(Hop-wise Attribution and Verification of Evidence)保证,最终形成3,333个平均3.7跳的高质量样例。除答案准确率外,MC-Search还引入推理质量、逐步检索与规划准确率等过程级指标。通过开发统一的智能体式MM-RAG流水线,我们评测了六个领先MLLM,揭示出过度检索与不足检索、模态错配规划等系统性问题。最后,我们提出Search-Align,一个利用经核验推理链的过程监督微调框架,表明我们的数据不仅能支持忠实评估,还能提升开源MLLM的规划与检索保真度。

MC-Search:用结构化长推理链评估与增强多模态Agentic搜索
图2:MC-Search 基准与评估概览。左:涵盖五种推理拓扑的基准,通过逐跳的证据归因与验证(hop-wise attribution and verification of evidence, HAVE)过程进行过滤。右:多模态智能体 RAG 流水线,其中 MLLM 迭代地生成子查询与动作,检索多模态证据,对检索到的信息进行推理,并加以整合以产生最终答案。我们的框架进一步将预测的推理链与黄金轨迹(golden trajectories)对齐,以评估链条级的检索与规划。