论文
MC-Search:用结构化长推理链评估与增强多模态Agentic搜索
MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains
摘要
随着对逐步、跨模态和知识锚定推理需求的增长,多模态大语言模型(MLLM)正从传统的固定“先检索后生成”范式演化为更复杂的智能体式多模态检索增强生成(MM-RAG)。然而,现有基准主要聚焦于短检索链的简化问答,对自适应规划与多模态推理的探索不足。我们提出MC-Search,首个面向智能体式MM-RAG的基准,带有横跨五种代表性推理结构的长、逐步标注推理链。每个样例规定子问题、检索模态、支持事实和中间答案,其保真度由HAVE(Hop-wise Attribution and Verification of Evidence)保证,最终形成3,333个平均3.7跳的高质量样例。除答案准确率外,MC-Search还引入推理质量、逐步检索与规划准确率等过程级指标。通过开发统一的智能体式MM-RAG流水线,我们评测了六个领先MLLM,揭示出过度检索与不足检索、模态错配规划等系统性问题。最后,我们提出Search-Align,一个利用经核验推理链的过程监督微调框架,表明我们的数据不仅能支持忠实评估,还能提升开源MLLM的规划与检索保真度。
