论文

Visual-Seeker:迈向经主动视觉的视觉原生多模态智能体搜索

Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning

智能体系统Agent 架构与控制循环

摘要

多模态大语言模型 (MLLM) 在许多视觉任务中表现出了令人印象深刻的能力,但在面对复杂的开放世界场景时,它们常常难以建立事实基础。虽然最近的多模态深度搜索代理试图通过利用外部工具来解决这个问题,但视觉原生搜索范式仍未得到充分探索。现有方法主要依赖于具有明确语义的简单图像和纯文本证据轨迹,限制了智能体执行多跳、跨模式推理和搜索的能力。为了解决这些限制,我们提出了 Visual-Seeker,一种通过主动视觉推理的视觉原生多模态深度搜索代理。我们的智能体没有将视觉视为静态输入,而是积极关注细粒度的视觉细节,在整个搜索过程中动态收集视觉证据。为了释放其视觉原生潜力,我们设计了主动视觉推理数据管道,并合成 5K 高质量多模态轨迹用于模型训练。大量的实验证明了在五个具有挑战性的多模态搜索基准中的最先进的性能,甚至超越了几个专有模型,验证了现实世界网络环境中强大的视觉原生推理和搜索。代码和数据可以访问:https://github.com/ZhengboZhang/Visual-Seeker。

Visual-Seeker:迈向经主动视觉的视觉原生多模态智能体搜索:论文配图
图 1:(a) 现实世界的图像查询通常呈现复杂、实体丰富的视觉内容。该模型必须利用其强大的视觉理解来准确识别目标实体并迭代地完善搜索过程。 (b) 多模态搜索代理应积极聚合来自网络来源的多模态证据,通过跨模态推理综合这些不同的线索以生成全面的答案。