论文

MTA-Agent:多模式深度搜索代理的开放配方

MTA-Agent: An Open Recipe for Multimodal Deep Search Agents

模型训练合成数据

摘要

多模态 大语言模型 (MLLM) 在视觉理解方面表现出了强大的能力,但它们在复杂的多步骤推理方面仍然受到限制,需要深度搜索并将视觉证据与外部知识相结合。在这项工作中,我们通过为多模式深度搜索代理构建高质量、经过验证的多跳视觉语言训练数据来应对这一挑战。我们提出了一种用于基于证据的 QA 合成的多跳工具增强代理(MTA-Agent),它自动选择工具及其参数来检索和验证来自视觉和文本来源的证据,并生成结构化的多跳问答轨迹。从不同的 VQA 种子数据集开始,我们的管道生成了一个大规模训练数据集 MTA-Vision-DeepSearch,其中包含 21K 个高质量多跳示例。数据通过多阶段验证过程进行过滤,以确保事实一致性和答案唯一性。使用 MTA-Vision-DeepSearch,32B 开源多模态搜索代理实现了最先进的性能,在六个具有挑战性的基准测试中平均达到 54.63\%,在相同工具设置下优于 GPT-5 (51.86\%)、Gemini-2.5-Pro (50.98\%) 和 Gemini-3-Pro (54.46\%)。我们进一步表明,对我们的数据进行训练可以提高推理深度和工具使用行为,将平均步数从 2.27 增加到 4.28,并导致更加系统和持久的搜索策略。此外,我们还证明,通过重播缓存的交互,无需实时工具调用即可执行训练,从而显着降低训练成本。重要的是,我们将 MTA-Agent 作为多模态深度搜索的完全开放配方:我们发布整个数据集、训练轨迹和实现细节,以实现开放多模态搜索代理的可重复性和未来研究。