论文

DeepVoyager-VL:激励长视野多模式代理的视觉在环搜索

DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents

智能体系统Agent 架构与控制循环

摘要

多模态 大语言模型 (MLLM) 具有先进的视觉理解和推理能力,但其静态参数知识限制了其解决知识密集型和动态演变的开放世界问题的能力。为了突破这一限制,多模态深度搜索已成为开放世界信息访问的关键方向,从单轮事实检索发展到视觉证据引导的长视野、多轮搜索。然而,现有的方法通常将视觉限制在输入或答案阶段,忽视了其在中间推理中的作用,并且缺乏针对长视野交互的设计。因此,视觉证据很少推动持续检索,从而限制了交互深度和推理广度。为了解决这些限制,我们提出了 DeepVoyager-VL,一种用于视觉循环搜索的长视野多模态深度搜索框架。具体来说,我们构建了一个多模式事件图来驱动数据合成,从而产生中间视觉依赖性和长推理链的问题。然后,我们设计了一个用于主动视觉采集和按需图像加载的代理框架。最后,我们在没有强化学习的情况下对合成数据的模型进行微调。十个多模态搜索基准的广泛实验证明了我们方法的有效性。